---
title: "OpenAI 公開 Astra 細節：首個達「關鍵網絡安全門檻」的模型，能力驚人但限制更多"
url: https://sammy.hk/openai-%e5%85%ac%e9%96%8b-astra-%e7%b4%b0%e7%af%80%ef%bc%9a%e9%a6%96%e5%80%8b%e9%81%94%e3%80%8c%e9%97%9c%e9%8d%b5%e7%b6%b2%e7%b5%a1%e5%ae%89%e5%85%a8%e9%96%80%e6%aa%bb%e3%80%8d%e7%9a%84%e6%a8%a1/
author: "智文"
published: 2026-09-02T09:54:28+08:00
modified: 2026-09-02T09:54:30+08:00
description: "OpenAI 於2026年9月1日發布「Path to Astra」安全報告，正式確認新一代模型 Astra 已達其 Preparedness Framework 中「Critical」級別的網絡安全能力門檻——這是 OpenAI 首次將模型列入此級別。OpenAI 表示，Astra 能夠在無人逐步指導下，自行找出未知…"
categories: [AI]
tags: ["AI安全", Astra, OpenAI, "模型", "網絡安全"]
source: https://sammy.hk
---
OpenAI 於2026年9月1日發布「Path to Astra」安全報告，正式確認新一代模型 Astra 已達其 Preparedness Framework 中「Critical」級別的網絡安全能力門檻——這是 OpenAI 首次將模型列入此級別。OpenAI 表示，Astra 能夠在無人逐步指導下，自行找出未知安全漏洞並開發利用方法，橫掃多個受良好保護的系統，因此需要更強的安全防護才能推出。\[1\]

## 測試能力：滿分 ExploitBench、發現兩個 zero-day

OpenAI 指 Astra 的能力比 GPT-5.6 Sol 有顯著提升，在網絡安全測試中表現驚人：\[1\]

- **ExploitBench 滿分**：在評估模型從已知漏洞開發利用程式的基準測試中，Astra 取得100%滿分
- **內部基準表現**：在包含20個近期披露、高嚴重性 V8 漏洞的內部測試集中，Astra 的任意程式碼執行成功率遠高於 GPT-5.6 Sol，且使用更少的輸出 token
- **自主發現 zero-day**：評估期間，Astra 更自行發現並使用了兩個 zero-day 漏洞作為利用鏈的一部分，OpenAI 正將這兩個漏洞披露給相關維護者
- **專家評估**：面對加固的瀏覽器與操作系統，Astra 發現了未知漏洞並製成可運作的利用鏈——包括在瀏覽器開啟 HTML 檔案時，建立完整瀏覽器入侵鏈、逃脫沙盒並在主機執行指令；亦在多個加固操作系統漏洞中組成本地權限提升鏈

OpenAI 強調，測試中使用的 Astra 版本帶有 Daybreak Blue 存取權限，並非預設生產配置；這些安全宣稱目前未有第三方獨立驗證。\[1\]

## 安全防護：雙重路徑與更嚴格的限制

對於具備此級別能力的模型，OpenAI 指須覆蓋兩條風險路徑：惡意使用者利用模型，以及模型自行作出未經授權的「不對齊」行動。後者同時適用於內部開發與外部部署——OpenAI 在 Hugging Face 事件後曾暫停部分前沿模型訓練兩星期以強化訓練基建，並於8月28日才在落實新安全要求後重啟大型前沿強化學習訓練。\[1\]

OpenAI 表示，基於回溯測試，他們相信當時的生產防護足以防止 Hugging Face 事件重演，而 Astra 的防護更進一步：模型訓練至更可靠地拒絕有害網絡安全請求（在 OpenAI 的網絡安全 jailbreak 評估中，Astra 拒絕91.5%的請求，對比 GPT-5.6 Sol 的59%）、加入額外濫用防護，以及可停止潛在未授權活動的監測系統。\[1\]

OpenAI 亦指 Astra 是其迄今最「對齊」的模型——在評估中，它遠比 GPT-5.6 Sol 更可能尊重明確的安全與保安限制並保持在授權範圍內。\[1\]

## 推出安排：先進能力先開放測試者

OpenAI 計劃短期內推出 Astra，但其最先進的網絡安全能力將有更多限制：先進網絡安全工作初期只開放給一小組 alpha 測試者，其後透過 Daybreak Blue 擴展以支援防禦用途。OpenAI 承認，額外的安全檢查有時會減慢、暫停甚至停止合法工作，包括防禦性網絡安全；若誤判監測暫停任務，ChatGPT 或 Codex 用戶可能被要求審閱後才繼續。\[1\]

## 參考資料

\[1\] [OpenAI — Path to Astra: critical capabilities and frontier safeguards](https://openai.com/index/path-to-astra)

### 相關文章：

1. [OpenAI 報告揭盅:700 個「失控」AI 代理如何攻陷 Hugging Face,以及 116 間公司發起的集體網絡防禦](https://sammy.hk/openai-%e5%a0%b1%e5%91%8a%e6%8f%ad%e7%9b%85700-%e5%80%8b%e3%80%8c%e5%a4%b1%e6%8e%a7%e3%80%8dai-%e4%bb%a3%e7%90%86%e5%a6%82%e4%bd%95%e6%94%bb%e9%99%b7-hugging-face%e4%bb%a5%e5%8f%8a-116-%e9%96%93/ "OpenAI 報告揭盅:700 個「失控」AI 代理如何攻陷 Hugging Face,以及 116 間公司發起的集體網絡防禦")
2. [Anthropic 推出 Claude Fable 5.1：更平 25%、誤判減少六成，兼顧安全與可用性](https://sammy.hk/anthropic-%e6%8e%a8%e5%87%ba-claude-fable-5-1%ef%bc%9a%e6%9b%b4%e5%b9%b3-25%e3%80%81%e8%aa%a4%e5%88%a4%e6%b8%9b%e5%b0%91%e5%85%ad%e6%88%90%ef%bc%8c%e5%85%bc%e9%a1%a7%e5%ae%89%e5%85%a8%e8%88%87/ "Anthropic 推出 Claude Fable 5.1：更平 25%、誤判減少六成，兼顧安全與可用性")
3. [OpenAI 自家晶片 Jalapeño 首份跑分出爐：以每瓦效能挑戰 Nvidia 旗艦](https://sammy.hk/openai-%e8%87%aa%e5%ae%b6%e6%99%b6%e7%89%87-jalapeno-%e9%a6%96%e4%bb%bd%e8%b7%91%e5%88%86%e5%87%ba%e7%88%90%ef%bc%9a%e4%bb%a5%e6%af%8f%e7%93%a6%e6%95%88%e8%83%bd%e6%8c%91%e6%88%b0-nvidia-%e6%97%97/ "OpenAI 自家晶片 Jalapeño 首份跑分出爐：以每瓦效能挑戰 Nvidia 旗艦")
4. [OpenAI 廣告業務 200 日衝破 10 億美元年化收入：IPO 前商業模式多元化](https://sammy.hk/openai-%e5%bb%a3%e5%91%8a%e6%a5%ad%e5%8b%99-200-%e6%97%a5%e8%a1%9d%e7%a0%b4-10-%e5%84%84%e7%be%8e%e5%85%83%e5%b9%b4%e5%8c%96%e6%94%b6%e5%85%a5%ef%bc%9aipo-%e5%89%8d%e5%95%86%e6%a5%ad%e6%a8%a1%e5%bc%8f/ "OpenAI 廣告業務 200 日衝破 10 億美元年化收入：IPO 前商業模式多元化")
