---
title: "DeepSeek 發佈 V4.1-Flash：MIT 授權開放權重、每百萬 token 低至 0.15 美元"
url: https://sammy.hk/deepseek-%e7%99%bc%e4%bd%88-v4-1-flash%ef%bc%9amit-%e6%8e%88%e6%ac%8a%e9%96%8b%e6%94%be%e6%ac%8a%e9%87%8d%e3%80%81%e6%af%8f%e7%99%be%e8%90%ac-token-%e4%bd%8e%e8%87%b3-0-15-%e7%be%8e%e5%85%83/
author: Ethan
published: 2026-09-12T09:21:22+08:00
modified: 2026-09-12T09:21:22+08:00
description: "DeepSeek 於2026年9月10日發佈新一代模型 DeepSeek-V4.1-Flash，權重以 MIT 授權開放於 Hugging Face，主打極致的推論成本壓縮。官方技術報告以「推進 KV Cache 壓縮的極限」為題，稱新模型在輸入密集型（input-heavy）的代理工作負載上大幅降低成本。[1][3]…"
categories: [AI]
tags: [DeepSeek, LLM, MoE, "人工智能", "開源模型"]
source: https://sammy.hk
---
DeepSeek 於2026年9月10日發佈新一代模型 DeepSeek-V4.1-Flash，權重以 MIT 授權開放於 Hugging Face，主打極致的推論成本壓縮。官方技術報告以「推進 KV Cache 壓縮的極限」為題，稱新模型在輸入密集型（input-heavy）的代理工作負載上大幅降低成本。\[1\]\[3\]

## 架構：以因果編碼器—解碼器壓縮 KV Cache

V4.1-Flash 為多模態混合專家（MoE）模型，主幹參數552B，支援最高100萬 token 上下文，原生處理圖像與文字。\[1\]

官方披露的核心設計包括：

- **因果編碼器—解碼器（CED）架構**：40層 Transformer 分為20層因果編碼器加20層解碼器；解碼器的全局 KV Cache 由編碼器最後一層的隱藏狀態投影而來，而非取自解碼器自身各層。此設計令模型在預填（prefill）階段每 token 只需啟動8B參數、解碼階段16B
- **壓縮稀疏注意力（CSA2）**：為每個注意力層分配 Full、Reindex 或 Reuse 三種靜態模式之一，跨層共享主 KV 與索引 K；配合 FP4 主 KV 快取（E2M1 格式），把全局 KV Cache 佔用降至每 token 890 位元組，約為 V4-Flash 的四分之一
- **SWA Bounded Replay**：藉重播最近 n\_win 個 token 重建缺失的滑動窗口注意力 KV 狀態，毋須把 KV 持久化至 SSD，持久 KV Cache 佔用降至 V4-Flash 約八分之一

官方圖表顯示，V4.1-Flash 的每 token KV Cache 相對 V4-Flash 減少約4倍，相對第一代 V1 更減少約437倍。\[1\]

模型以45萬億（45T）tokens 的多模態語料從頭訓練，稀疏注意力訓練序列長度為64K，並於34T tokens 時把上下文擴展至100萬 token。後訓練沿用標準的 SFT → RL → 在線策略蒸餾（OPD）流程，主要改動在於大規模自動合成代理任務與環境。\[1\]

## 效能：代理與編程基準超越自家旗艦

官方評測顯示，V4.1-Flash 在多項代理與編程基準上超越參數規模大得多的 V4-Pro（1.6T 主幹）：\[1\]

- **Terminal-Bench 2.1**：90.6分，高於 GPT-5.6 Sol 的88.8與 Opus-5.0 的89.1
- **DeepSWE v1.1**：74.2分，略高於 Opus-5.0 的74.0
- **CyberGym**：88.1分，為表列最高
- **Codeforces**：評分3471，為表列最高
- **AutomationBench**：54.8分，高於 Opus-5.0 的50.3

模型支援1至100的連續可調推理強度（reasoning effort），讓開發者按任務在推論成本與準確度之間取捨。官方指在 HLE（Humanity’s Last Exam）等前沿推理基準上，V4.1-Flash 仍落後頂尖閉源模型。\[1\]

## 定價與服務安排

API 方面，V4.1-Flash 以 `deepseek-flash` 作為預設模型名稱，舊名稱 `deepseek-v4-flash` 已退役但繼續接受請求，由 V4.1-Flash 接手處理並按 Flash 價格收費。官方同時公布，因應用戶需求，DeepSeek V4 Pro 在9月14日之後將繼續提供 API 服務，收費方式不變。\[2\]

## 參考資料

\[1\] [DeepSeek-V4.1-Flash 模型卡（Hugging Face）](https://huggingface.co/deepseek-ai/DeepSeek-V4.1-Flash)

\[2\] [DeepSeek API Docs — News](https://api-docs.deepseek.com/news)

\[3\] [DeepSeek-V4.1-Flash 技術報告（PDF）](https://huggingface.co/deepseek-ai/DeepSeek-V4.1-Flash/blob/main/DeepSeek_V41_Tech_Report.pdf)

### 相關文章：

1. [揭開「Ox Alpha」之謎：智譜 Z.ai 的 GLM-5.3-Flash 如何以匿名之姿攻陷 OpenRouter](https://sammy.hk/%e6%8f%ad%e9%96%8b%e3%80%8cox-alpha%e3%80%8d%e4%b9%8b%e8%ac%8e%ef%bc%9a%e6%99%ba%e8%ad%9c-z-ai-%e7%9a%84-glm-5-3-flash-%e5%a6%82%e4%bd%95%e4%bb%a5%e5%8c%bf%e5%90%8d%e4%b9%8b%e5%a7%bf%e6%94%bb%e9%99%b7/ "揭開「Ox Alpha」之謎：智譜 Z.ai 的 GLM-5.3-Flash 如何以匿名之姿攻陷 OpenRouter")
2. [Nvidia 以 129 億美元收購 Hugging Face：「AI 的 GitHub」落入晶片巨頭手中](https://sammy.hk/nvidia-%e4%bb%a5-129-%e5%84%84%e7%be%8e%e5%85%83%e6%94%b6%e8%b3%bc-hugging-face%ef%bc%9a%e3%80%8cai-%e7%9a%84-github%e3%80%8d%e8%90%bd%e5%85%a5%e6%99%b6%e7%89%87%e5%b7%a8%e9%a0%ad%e6%89%8b%e4%b8%ad/ "Nvidia 以 129 億美元收購 Hugging Face：「AI 的 GitHub」落入晶片巨頭手中")
3. [開放權重 AI 成為矽谷最搶手資產：Stripe 收購 OpenRouter、Nvidia 重金押注 Poolside](https://sammy.hk/%e9%96%8b%e6%94%be%e6%ac%8a%e9%87%8d-ai-%e6%88%90%e7%82%ba%e7%9f%bd%e8%b0%b7%e6%9c%80%e6%90%b6%e6%89%8b%e8%b3%87%e7%94%a2%ef%bc%9astripe-%e6%94%b6%e8%b3%bc-openrouter%e3%80%81nvidia-%e9%87%8d%e9%87%91/ "開放權重 AI 成為矽谷最搶手資產：Stripe 收購 OpenRouter、Nvidia 重金押注 Poolside")
4. [用 Open Design 建立可重用的 AI 設計系統：DESIGN.md 一檔走天涯](https://sammy.hk/%e7%94%a8-open-design-%e5%bb%ba%e7%ab%8b%e5%8f%af%e9%87%8d%e7%94%a8%e7%9a%84-ai-%e8%a8%ad%e8%a8%88%e7%b3%bb%e7%b5%b1%ef%bc%9adesign-md-%e4%b8%80%e6%aa%94%e8%b5%b0%e5%a4%a9%e6%b6%af/ "用 Open Design 建立可重用的 AI 設計系統：DESIGN.md 一檔走天涯")
