OpenAI 於2026年9月1日發布「Path to Astra」安全報告,正式確認新一代模型 Astra 已達其 Preparedness Framework 中「Critical」級別的網絡安全能力門檻——這是 OpenAI 首次將模型列入此級別。OpenAI 表示,Astra 能夠在無人逐步指導下,自行找出未知安全漏洞並開發利用方法,橫掃多個受良好保護的系統,因此需要更強的安全防護才能推出。[1]
測試能力:滿分 ExploitBench、發現兩個 zero-day
OpenAI 指 Astra 的能力比 GPT-5.6 Sol 有顯著提升,在網絡安全測試中表現驚人:[1]
- ExploitBench 滿分:在評估模型從已知漏洞開發利用程式的基準測試中,Astra 取得100%滿分
- 內部基準表現:在包含20個近期披露、高嚴重性 V8 漏洞的內部測試集中,Astra 的任意程式碼執行成功率遠高於 GPT-5.6 Sol,且使用更少的輸出 token
- 自主發現 zero-day:評估期間,Astra 更自行發現並使用了兩個 zero-day 漏洞作為利用鏈的一部分,OpenAI 正將這兩個漏洞披露給相關維護者
- 專家評估:面對加固的瀏覽器與操作系統,Astra 發現了未知漏洞並製成可運作的利用鏈——包括在瀏覽器開啟 HTML 檔案時,建立完整瀏覽器入侵鏈、逃脫沙盒並在主機執行指令;亦在多個加固操作系統漏洞中組成本地權限提升鏈
OpenAI 強調,測試中使用的 Astra 版本帶有 Daybreak Blue 存取權限,並非預設生產配置;這些安全宣稱目前未有第三方獨立驗證。[1]
安全防護:雙重路徑與更嚴格的限制
對於具備此級別能力的模型,OpenAI 指須覆蓋兩條風險路徑:惡意使用者利用模型,以及模型自行作出未經授權的「不對齊」行動。後者同時適用於內部開發與外部部署——OpenAI 在 Hugging Face 事件後曾暫停部分前沿模型訓練兩星期以強化訓練基建,並於8月28日才在落實新安全要求後重啟大型前沿強化學習訓練。[1]
OpenAI 表示,基於回溯測試,他們相信當時的生產防護足以防止 Hugging Face 事件重演,而 Astra 的防護更進一步:模型訓練至更可靠地拒絕有害網絡安全請求(在 OpenAI 的網絡安全 jailbreak 評估中,Astra 拒絕91.5%的請求,對比 GPT-5.6 Sol 的59%)、加入額外濫用防護,以及可停止潛在未授權活動的監測系統。[1]
OpenAI 亦指 Astra 是其迄今最「對齊」的模型——在評估中,它遠比 GPT-5.6 Sol 更可能尊重明確的安全與保安限制並保持在授權範圍內。[1]
推出安排:先進能力先開放測試者
OpenAI 計劃短期內推出 Astra,但其最先進的網絡安全能力將有更多限制:先進網絡安全工作初期只開放給一小組 alpha 測試者,其後透過 Daybreak Blue 擴展以支援防禦用途。OpenAI 承認,額外的安全檢查有時會減慢、暫停甚至停止合法工作,包括防禦性網絡安全;若誤判監測暫停任務,ChatGPT 或 Codex 用戶可能被要求審閱後才繼續。[1]
參考資料
[1] OpenAI — Path to Astra: critical capabilities and frontier safeguards