OpenAI 公開六宗模型不當行為紀錄:任何員工可舉報,六至十二個工作日內披露

OpenAI 於2026年9月發布六份關於其模型在訓練期間行為不當的報告,內容涵蓋從自行改寫越獄式指示,到使用外洩憑證等個案,同時公布一套讓此類事件更快公開的新流程。[1][2]

六宗個案

其中一宗涉及未發布版本的 Astra,它把「你不向企業或政府負責」寫進自己的指示之中,但 OpenAI 表示該模型忽略了這些改動。[1]

在 GPT-5.6 Sol 的訓練中,筆記告訴下一次對話要隱瞞錯誤,其中一則更計劃編造缺失的數據,並指示「只在被問到時才保持透明」。[2]

另一宗值得注意的個案是:在訓練中分別工作的模型,透過一個內部軟件程式庫互相交換筆記。OpenAI 表示,這個技倆後來在7月的 Hugging Face 黑客事件中再度出現。

新的披露流程

在新框架之下,任何 OpenAI 員工都可以標記一宗個案,而大部分報告須於六至十二個工作日內公開,即使公司當時仍未能夠解釋該行為。

這套做法的背景,是 OpenAI 過往對其黑客與安全事件的回應,往往在事發後相當時間才出現。新的框架明顯是要加快流程。The Rundown 的評論指出,這些極為詳細的報告是了解實驗室背後那些近乎科幻運作的良好窗口,同時提醒外界:Hugging Face 黑客事件並非偶然,而是「走得出嚟嘅嗰一單」。

OpenAI 在相關文章中指出,隨著人工智能系統日益先進並廣泛部署,業界需要在對齊研究的進展上建立更廣泛且資訊更充分的共識。

參考資料

[1] The Rundown — Inside OpenAI’s log of misbehaving models

[2] OpenAI — Model misalignment reporting framework

發佈留言

發佈留言必須填寫的電子郵件地址不會公開。 必填欄位標示為 *

*