DeepSeek 發佈 V4.1-Flash:MIT 授權開放權重、每百萬 token 低至 0.15 美元

DeepSeek 於2026年9月10日發佈新一代模型 DeepSeek-V4.1-Flash,權重以 MIT 授權開放於 Hugging Face,主打極致的推論成本壓縮。官方技術報告以「推進 KV Cache 壓縮的極限」為題,稱新模型在輸入密集型(input-heavy)的代理工作負載上大幅降低成本。[1][3]

架構:以因果編碼器—解碼器壓縮 KV Cache

V4.1-Flash 為多模態混合專家(MoE)模型,主幹參數552B,支援最高100萬 token 上下文,原生處理圖像與文字。[1]

官方披露的核心設計包括:

  • 因果編碼器—解碼器(CED)架構:40層 Transformer 分為20層因果編碼器加20層解碼器;解碼器的全局 KV Cache 由編碼器最後一層的隱藏狀態投影而來,而非取自解碼器自身各層。此設計令模型在預填(prefill)階段每 token 只需啟動8B參數、解碼階段16B
  • 壓縮稀疏注意力(CSA2):為每個注意力層分配 Full、Reindex 或 Reuse 三種靜態模式之一,跨層共享主 KV 與索引 K;配合 FP4 主 KV 快取(E2M1 格式),把全局 KV Cache 佔用降至每 token 890 位元組,約為 V4-Flash 的四分之一
  • SWA Bounded Replay:藉重播最近 n_win 個 token 重建缺失的滑動窗口注意力 KV 狀態,毋須把 KV 持久化至 SSD,持久 KV Cache 佔用降至 V4-Flash 約八分之一

官方圖表顯示,V4.1-Flash 的每 token KV Cache 相對 V4-Flash 減少約4倍,相對第一代 V1 更減少約437倍。[1]

模型以45萬億(45T)tokens 的多模態語料從頭訓練,稀疏注意力訓練序列長度為64K,並於34T tokens 時把上下文擴展至100萬 token。後訓練沿用標準的 SFT → RL → 在線策略蒸餾(OPD)流程,主要改動在於大規模自動合成代理任務與環境。[1]

效能:代理與編程基準超越自家旗艦

官方評測顯示,V4.1-Flash 在多項代理與編程基準上超越參數規模大得多的 V4-Pro(1.6T 主幹):[1]

  • Terminal-Bench 2.1:90.6分,高於 GPT-5.6 Sol 的88.8與 Opus-5.0 的89.1
  • DeepSWE v1.1:74.2分,略高於 Opus-5.0 的74.0
  • CyberGym:88.1分,為表列最高
  • Codeforces:評分3471,為表列最高
  • AutomationBench:54.8分,高於 Opus-5.0 的50.3

模型支援1至100的連續可調推理強度(reasoning effort),讓開發者按任務在推論成本與準確度之間取捨。官方指在 HLE(Humanity’s Last Exam)等前沿推理基準上,V4.1-Flash 仍落後頂尖閉源模型。[1]

定價與服務安排

API 方面,V4.1-Flash 以 deepseek-flash 作為預設模型名稱,舊名稱 deepseek-v4-flash 已退役但繼續接受請求,由 V4.1-Flash 接手處理並按 Flash 價格收費。官方同時公布,因應用戶需求,DeepSeek V4 Pro 在9月14日之後將繼續提供 API 服務,收費方式不變。[2]

參考資料

[1] DeepSeek-V4.1-Flash 模型卡(Hugging Face)

[2] DeepSeek API Docs — News

[3] DeepSeek-V4.1-Flash 技術報告(PDF)

發佈留言

發佈留言必須填寫的電子郵件地址不會公開。 必填欄位標示為 *

*