OpenAI 推出 GPT-6 Sol 與 Luna:API 減價一半、錯誤約減半

OpenAI 推出 GPT-6 Sol 與 Luna:API 減價一半、錯誤率減半

OpenAI 於 2026 年 9 月 22 日發表 GPT-6 Sol 與 GPT-6 Luna,為本月初推出的 GPT-6 Astra 之後的新成員。官方指出,兩款模型以相近方法訓練,把 Astra 在專業工作、事實準確度、編程、電腦操作與對齊方面的進展,帶到速度更快、價格更低的型號之上。[1]

定位與價格

GPT-6 Sol 針對較複雜的工作,例如編程;GPT-6 Luna 則面向目標明確、數量龐大的文書工作,包括總結文件、抽取資料與快速問答。[1]

價格方面,OpenAI 把 Sol 與 Luna 的 API 定價較 GPT-5.6 的推廣價下調五成(每百萬 token):Sol 輸入由 4 美元降至 2 美元、輸出由 20 美元降至 10 美元;Luna 輸入由 0.20 美元降至 0.10 美元、輸出由 1.20 美元降至 0.50 美元。官方表示減價來自快取與推論效率改善,並將節省直接回饋用戶。[1]

官方評測數據

在測試跨應用商業工作流程的 AutomationBench 中,GPT-6 Sol(xhigh effort)得分 33.2%,每次任務成本 0.27 美元;官方比較 GPT-6 Astra(low effort)得分 30.3% 而成本為 Sol 的 3.9 倍,Claude Opus 5(max effort)得分 26.9% 而成本為 Sol 的 11.1 倍。[1]

在評估長時間專業工作流程的 Agents’ Last Exam 中,GPT-6 Sol(max effort)得分 56.4%,官方稱高於 Claude Opus 5 在該評測的最高分,而每次任務成本低 60%。在 DeepSWE v1.1 中,Sol(max effort)得分 68.8%,與 Claude Fable 5 的最高分 69.9% 相差 1.1 個百分點,成本約低八成;Luna(max effort)得分 66.6%,官方稱與 Opus 5 及 Fable 5 的中等 effort 相若,而每次任務成本分別低 93% 與 96%。在 OSWorld 2.0 離線測試中,Sol(xhigh)得分 60.5%,與 Claude Opus 5(medium)的 60.3% 相若,成本約低八成。[1]

事實準確度與幻覺風格

在 OpenAI 以真實對話(用戶曾標記模型出錯)建立的內部事實準確度評測中,GPT-6 Sol 錯誤次數約為上一代的一半,官方形容其在低成本下接近 Astra 級可靠;Luna 亦有明顯改善,在高 effort 設定下與 GPT-5.6 Sol 相若,而成本約為其百分之一。[1]

OpenAI 同步把 Astra 的幻覺風格帶到 Sol 與 Luna,官方稱在技術與編程對話中會更清晰、較少冗詞、較少低價值細節,整體回覆迴覆更短而不失內容。[1][2]

對齊與取用

官方表示 Sol 與 Luna 建基於 Astra 的對齊工作,在對齊評測中較 GPT-5.6 同類模型改善,包括較少就編程工作產生誤導性錯誤;詳細結果載於系統卡。[1][2]

取用方面,GPT-6 Sol 與 Luna 即日起在 ChatGPT Work 與 Codex 向所有 Plus、Pro、Business、Enterprise 及 Edu 用戶提供;免費用戶與 Go 用戶可在桌面應用使用 GPT-6 Luna,兩款模型暫未在 Chat 提供。API 型號分別為 gpt-6-solgpt-6-luna;官方表示會於當日陸續推送,若未看到新模型可稍後再試。[1]

參考資料

[1] OpenAI — Introducing GPT-6 Sol and Luna

[2] OpenAI — GPT-6 Astra(系統卡)

發佈留言

發佈留言必須填寫的電子郵件地址不會公開。 必填欄位標示為 *

*