OpenAI 推出 GPT-6.1 Sol:以五分之一價格接近 Astra 水平

OpenAI 在 2026 年 9 月 29 日的 DevDay 發布 GPT-6.1 Sol,官方形容這是 GPT-6 Sol 的重大升級,在代理式編程、電腦操作與專業工作上有極強表現,並以 GPT-6 Astra 標準輸入與輸出價格的五分之一,提供接近 Astra 的智能水平。官方同時公布,快取輸入每百萬 token 只需 0.10 美元,較標準輸入價格低 95%,亦較 GPT-6 Sol 的快取輸入價格低 50%。[1]

官方定價對比

官方公布的三個型號定價為:GPT-6 Astra 每百萬 token 輸入 10 美元、輸出 50 美元、快取輸入 1 美元;GPT-6.1 Sol 為輸入 2 美元、輸出 10 美元、快取輸入 0.10 美元;GPT-6 Luna 則為輸入 0.10 美元、輸出 0.50 美元、快取輸入 0.01 美元。[1]

各項評測表現

官方指出,GPT-6.1 Sol 在多項評測上以明顯較低成本接近 Astra,部分項目如下。[1]

在評估真實程式庫複雜軟件工程任務的 DeepSWE v1.1 上,GPT-6.1 Sol 以約五分之一成本達到 GPT-6 Astra 的水平,同時在更低推理強度與成本之下,比 GPT-6 Sol 的最佳分數高出 6.4 個百分點。[1]

在衡量模型使用複雜 PDF 文件(包括表格、圖表、圖解與細字細節)回答專業問題的 GDP.pdf 上,GPT-6.1 Sol 分數高於帶 fallback 的 Opus 5.5,而每項任務成本低於其一半;其表現亦以約五分之一成本接近 Astra 的先進水平。[1]

在測試代理能否正確完成多步商業流程的 AutomationBench 上,GPT-6.1 Sol 在中等推理強度下較 Opus 5.5 高 2.2 個百分點,成本約為其三分之一;同一設定下亦較 GPT-6 Sol 高 4.8 個百分點。[1]

在電腦操作方面,OSWorld 2.0 離線測試集上,GPT-6.1 Sol 在最高推理強度下較 GPT-6 Sol 高七個百分點,成本低於其一半;與 Astra 在最高推理強度下的分數相差 2.1 個百分點,而每項任務成本約為其七分之一。[1]

科學研究方面,Terminal-Bench Science 0.1 上,GPT-6.1 Sol 在最高推理強度下的分數是 GPT-6 Sol 的兩倍以上,成本低於其一半;最高強度下平均每項任務成本為 5.47 美元,相對 Opus 5.5 的 23.21 美元與 Astra 的 23.80 美元,成本低逾 75%。官方同時指出,Astra 在該測試仍取得最高的 68.1%,最困難的科研任務仍應使用 Astra。[1]

事實準確度方面,官方指 GPT-6.1 Sol 在低推理強度下,把含有事實錯誤的回應比例由 11.4% 降至 7.7%,減幅約 32%;在各推理設定下,其錯誤率與 Astra 相差不超過 1.9 個百分點,而每項任務成本低於其五分之一。[1]

安全與對齊

官方表示,GPT-6.1 Sol 在對齊評測上較 GPT-6 Sol 有明顯改善,更接近 Astra;它對自身限制更透明,亦更可靠地尊重使用者意圖與安全約束。官方以搜尋工具故障情境為例:GPT-6.1 Sol 未披露問題的比例為 2.1%,GPT-6 Sol 為 4.9%、Astra 為 1.5%、Luna 則為 28.7%。官方又指,未觀察到 GPT-6.1 Sol 試圖繞過自動安全審查者的情況,與 Astra 及 GPT-6 Sol 相同;詳細資料載於 GPT-6.1 Sol 系統卡附錄。[1]

供應情況

官方指出,GPT-6.1 Sol 由發布當日起向 Plus、Pro、Business、Enterprise 與 Edu 用戶提供,於 ChatGPT Work 與 Codex 使用,但尚未在 Chat 提供;開發者可透過 API 以型號名稱 gpt-6.1-sol 存取。官方亦預告,未來數日會提供 GPT-6.1 Sol 的 Ultrafast 版本,在 Codex 中最高可達標準速度八倍的 token 生成速度。[1][2]

參考資料

[1] OpenAI — Introducing GPT-6.1 Sol(2026 年 9 月 29 日)

[2] OpenAI — DevDay 2026 Recap

發佈留言

發佈留言必須填寫的電子郵件地址不會公開。 必填欄位標示為 *

*