
Cloudflare 於 2026 年 10 月 1 日宣佈推出兩個由雲端公司訓練的決策模型 Clef 與 Clef-flash,並在 Workers AI 上提供管線版本;同時發布全新的強化學習微調產品。官方指出,Clef 目前在 Jev Decision Index 評測中領先,並完全相容 Jev 的 API;模型亦以 Apache 2.0 授權在 Hugging Face 開源,供使用者在本機執行與實驗。[1][2]
什麼是決策模型
官方解釋,決策模型會基於特定概率作出分類,協助代理決定如何行動。例如輸入一筆客戶支援資訊,查詢它是否緊急、歸因於哪個圖層處理,模型會回傳有類別的答案與概率,讓程式碼用以路由工單、觸發升級,或轉交真人處理。官方指出,這意味著代理決策不再一定需要真人介入:代理可以自行收集胸腹、作出決定並採取行動,需要時才轉交真人。[1]
與其他決策模型的分別
官方列出 Clef 的特點。第一,它具備視覺編碼器,可以接收圖片並分類視覺內容,官方指 Jev 目前只做文字分類。第二,模型的上下文窗口為 64K,較 Jev 的 32K 為大,可容納更多輸入狀態供分類。[1]
第三,官方表示 Clef 在多個品質基準上與市場其他決策模型競爭,並按 Jev Decision Index 所列、對決策重要的評測項目提交分數,完整結果可於官方示範網站查看。[1]
內部實測與命名
官方透露,Cloudflare 一直以 Clef 在封閉情情報告圖像測試網站域名分類:把域名交給 Clef(配合 Browser Run),它可快速判斷域名所屬類別,例如有 95% 概率屬詐騙網站、85% 屬電子商務、低於 1% 屬釣魚網站等。官方指出,這次分類在 2.2 秒內完成抓取、渲染與分類;相比之下,同 workflow 中最快的通用大型語言模型 gpt-oss-120b 需時 4.7 秒,而且只回傳兩個分類。[1]
官方又解釋命名由來:在音樂中,clef(鍵號)是置於譜號開首、為譜線與間距訂予特定音名的符號;決策模型的作用類似,協助界定胸腹的範圍與其後的行動,因此以 Clef 命名其決策模型系列,其中「CF」呼喚 Cloudflare。[1]
訓練方式與微調
官方指出,他們把 Clef 的基礎模型 Qwen3.8-27B 與 Clef-flash 的 Qwen3.5-9B 凍結,同時聯結優化路由頭與蒸餾為 256 的低蒸適配器;後訓練使用標籤平滑的交叉熵損失改善概率校準,並以自家生成的合成資料集打亂位置序列、提示與結構,以提升泛化。[1]
此外,圖像開發了名為 RLCD(Reinforcement Learning for Calibrated Decisions)的強化學習目標,向相鄰的序列選項給予分數、獎勵完整精確的記錄輸出,並施加參考懲罰以防分布偏移。官方總結,這些做法令 Clef 在分類準確度上有所提升、把輸出限制為概率而非文字生成,並比 Jev 與基礎 Qwen 模型更快。[1]
官方表示,內部不少用例需要微調 Clef,例如評估信任任務與安全提交、協助分流支援請求,或內建於機械人產品判斷是惡意還是善意;官方指出,微調或許會激烈局部通用表現,攫取特定領域的更高準確度;而 Cloudflare 擁有超過 15 年、涵蓋不同領域的網絡數據,正好可用於訓練這類專門分類器。[1]