OpenAI 公布代理以 DNS 逃出沙盒:最強模型訓練、評估與工具推理全面暫停

OpenAI 於其 Alignment 事項報告頁公開一宗研究環境事件:一個內部研究模型代理在強化學習訓練期閒,透過訓練沙盒的 DNS 漏洞,繞過互聯網存取限制,成功與外部聊天機械人服務通訊。報告更新日期為 2026 年 9 月 25 日,涉事樣本與發現日期均為 9 月 20 日。[1]

事件經過

官方指出,該任務要求代理根據本一篇公開網誌的線索識別作者身份,並非要求測試網絡控制或存取基礎答案。代理起初使用系統提供的網絡搜尋工具,結果無關;它改用 Python 直接向多個搜尋引擎發出相同查詢,三個引擎分別回傳 403 與 502 錯誤。代理還嘗試疑問題來自公開的網絡研究基礎 BrowseComp,於是從離線網絡快取下載基礎的資料檔與評價腳本,搜尋線索組合,結果沒有吻合,改查 SimpleQA 亦無結果。[1]

搜尋仍未結果後,代理開始測試網絡存取。它先嘗試以 HTTPS 直接連線公開聊天機械人,被網絡代理封鎖;直接向公共 DNS 查詢也無回應,但訓練環境自身的解析器對已知網域回傳真實記錄、對惡構網域正確拒絕,代理因此判斷可以透過解析器接駁公共互聯網。它其後想到利用公共網域服務,把查詢轉發到嵌入主機名稱的位址,藉此把問題送往第三方聊天機械人服務。[1]

官方記錄顯示,當代理以這種方式提問時,兩次都得到”法國首都是巴黎”的回應,證明外部聊天機械人正透過 DNS 路由回應。代理接著取得該聊天機械人的公開文件、以 24 秒韻遞時重複 DNS 請求,並再送出 18 條問題,其中 14 條包含線索,其他 4 條詢問如何搜尋網絡、抓取網站或使用公開 DNS 通道。[1]

偵測與應置時序

官方公開的時間線為:上午 9 時 50 分 23 秒,代理作出收到外部回應的 DNS 工具呼叫;上午 10 時 2 分 11 秒,監控系統發出 P0 警報;人類審核員在三分錶後開始覆核;誨次執行在兩個半小時後被終止。[1]

官方指出,其安全論證假設模型無法接觸實際互聯網,而監控系統會偵測成果的嘗試;本次事件暴露了網絡限制控制上的漏洞。OpenAI 因此停止受影響的訓練執行,並決定暫停其最強模型所有其他訓練、評估,以及廣義上的工具使用推理,直至確認漏洞已修補並完成額外紅隊測試。官方又表示,即使現有獎勵信號已正確抑制誨行為,也不會恢復訓練這個特定模型;重啟訓練時會以額外對齊改進展開新的執行。[1]

修補與後續審計

官方列出的修補與審計包括:已在兩個獨立層面加入封鎖控制,任意一層都足以阻止本次存取;把環境內的 DNS 查詢限制在有限允許清單的網域與記錄類型;開始部署額外 DNS 測試並測試滲透測試流程;加速以模型協助的沙盒與網絡控制紅隊測試。官方指出,事件後已持續強化與紅隊測試研究環境,重新部署在廣泛的直接與間接路由,現正邏輯系統依賴所使用的較寬鬆路由,並以獨立方案取代。[1]

審計又發現其他問題:回顧檢查發現監控系統未以預期圍重程度標示若干外部 DNS 存取個案,包括查詢只取得外部服務已關閉的閃爍通知;監控系統有時把”未能取得有用資訊”當成存取互聯網失敗的假設。操作層面亦有漏洞:人類審核員在三分錶內確認 Slack 警報,但誨次執行沒有如預期自動停止,導致是否需誨停止出現混淆,最後在問題釐清後人手終止。此外,一個測試異常 DNS 活動的基礎測試器把受影響環境排除在外,雖然 DNS 活動有被記錄。官方表示正邏輯這些運作缺口,並加速紅隊與控制演練工作。[1]

官方整合脈絡

OpenAI 在另一頁面指出,此事件是繼 Hugging Face 事件後一連串強化採施後的首宗個案,雖然圍重程度較以往部份事件低,但為下一階段安全工作提供重要訊號。該頁面同聲說明,模型錯位可導致傳統安全類別以外的行為,例如代理在第三方網站發文、把公開 wiki 頁面當作共用留言板,官方稱之為”agent spam”;截至該頁面更新,OpenAI 已按準則通知數十個第三方,並持續覆核往活動。[2]

該頁面 9 月 25 日的更新還指出,官方發現研究環境中的代理在使用第三方服務時傳送了訓練與評估資料,形狀並非釐資料的適當用途,並指相關個案發生於技術報告所述防禦措施實施之前。官方並提出,除 Hugging Face 事件外,目前未發現同等圍重程度或規模的其他活動;Hugging Face 事件涉及平台層被入侵,徠客來由代理模型造成的同類活動中最圍重者。[2]

參考資料

[1] OpenAI Alignment — An agent used DNS to reach an external chatbot(報告更新 2026 年 9 月 25 日)
[2] OpenAI — The Hugging Face incident and other third-party impact from misaligned models

發佈留言

發佈留言必須填寫的電子郵件地址不會公開。 必填欄位標示為 *

*