StepFun Step 5 Preview:600B 稀疏 MoE 與 1M 上下文的代理模型

StepFun Step 5 Preview:600B 稀疏 MoE 與 1M 上下文的代理模型

內地模型公司 StepFun(稀宇科技)於 2026 年 9 月 20 日發布 Step 5 Preview,定位為面向代理式工作(agentic work)的旗艦模型,主打軟件工程、專業知識工作與金融場景。[1][2]

規格與能力

Step 5 Preview 採用稀疏混合專家(MoE)架構,總參數 600B,每個 token 啟用 27B,支援 1M token 上下文,並原生接受文字、圖像與影片輸入,輸出為文字。[1][2]

官方 API 文件列出多項規格:最大輸入 1M token、最大輸出 64k token;圖像以 URL 或 Base64 輸入,支援 JPG、PNG、WebP 與靜態 GIF,每次請求最多 60 張圖;影片支援 MP4、QuickTime 與 Matroska,經 URL 輸入的單個 MP4 須小於 128MB,官方建議片長少於五分鐘。功能上支援串流輸出、工具呼叫、JSON Mode 與 JSON Schema 結構化輸出、提示快取,以及 low/medium/high 三級推理強度。[2]

官方文件同時說明工具、搜尋與程式執行能力由接入模型的應用提供,模型本身不會存取用戶本地環境或外部服務。[2]

官方評測數據

StepFun 公布多項基準測試成績,包括 DeepSWE v1.1 得 67.7、StepCodeBench 平均 @4 得 49.0、ProgramBench 通過率 80.5、Terminal-Bench v4 得 33.3、Agents’ Last Exam(ALE-CLI)29.5、GDPval-AA v2 得 1571、FrontierFinance 得 66.4、Draco 得 83.3。[1]

官方亦引述第三方評測機構 Artificial Analysis 的數據,指 Step 5 Preview 在 Intelligence Index 取得 44 分,並在同等智能水平下具備較低的每任務成本。官方自行開發的 StepCodeBench 涵蓋 553 個獨立程式庫、9 類任務、20 個應用領域與 33 種程式語言;StepFun 指出模型在修錯、功能修改與重構表現較佳,於低至中等難度任務接近 Claude Opus 5,但在最具挑戰性的長時程任務仍有明顯差距。[1]

長時程任務與自動化實驗

官方以兩個可量度回饋的實驗展示長時程能力。其一是讓模型在 NVIDIA H100 上由零開始優化 MLA GPU kernel,歷時約 22 小時後達到 508 TFLOPS(前向與反向),官方比較數字為 Claude Opus 5 的 493 TFLOPS。其二是以 24 小時自動改善後訓練資料迴圈,令 Qwen3-30B-A3B 基礎模型在 AIME24 的準確率由 53.3% 提升至 60%,官方稱與 Claude Opus 5 的結果相若而使用較少標註 token。[1]

取用方式與開放權重

Step 5 Preview 已即日透過 StepFun 產品與 API 提供,官方表示模型將於 10 月 15 日以開放權重形式發布。開發者可於 StepFun 開放平台建立 API key,按其 Quickstart 以 cURL 或 Python 發送請求,官方文件亦提供與 Claude Code 整合及 1M 上下文的設定說明。計費按實際輸入與輸出 token 用量計算,價格、快取計費規則與帳戶速率限制須查閱官方定價頁。[1][2]

參考資料

[1] StepFun — Step 5 Preview: Advancing the Pareto Frontier

[2] StepFun 官方文件 — Step 5 Preview 模型指南

發佈留言

發佈留言必須填寫的電子郵件地址不會公開。 必填欄位標示為 *

*