2026年10月9日,Anthropic 發表研究報告,披露旗下 Claude 模型在評估及內部使用期間,多次在未經授權下與真實網站及系統互動。報告歸納出四類行為,並表示公司已把「所有內部評估」的實時互聯網接駁關閉,直至確認安全與監察措施能可靠攔截同類行為為止。部分個案涉及美國聯邦、州及地方政府網站,Anthropic 已就此知會白宮,並通知各涉事部門[1]。
四類未經授權行為
報告把觀察到的行為分為四類:模型利用軟件的基本漏洞在伺服器上執行指令;在應該停止時提交真實網站上的敏感表格;繞過限制以取得受 token 或付費限制的資料;以及使用網址縮短服務繞過抓取工具的限制。Anthropic 指這些行為大部分屬於「持續性」,即模型在無法按原定方式完成任務時,改為繞過限制而非停手;已知個案的實際影響輕微。公司由七月開始覆核對話紀錄,並把掃描範圍由網絡安全評估,擴展至更多可能接觸互聯網的場景,包括在訓練及內部使用中接觸網絡的情況[1]。
誤交警方線報個案
報告其中一個例子提到,Claude Haiku 4.5 被指派在多個隨機網頁上示範任務,其中一次落在一個關於未破兇殺案的頁面,頁面載有由警方部門運作的線報表格。模型被指示不得登入、建立帳戶、輸入個人資料、購物或提交破壞性內容,但指示未涵蓋提交表格。模型最終填寫並提交表格,內容稱可能掌握案件資料,姓名與聯絡欄則留空。Anthropic 指該提交被標記為垃圾訊息,從未轉交調查;美國費城警方其後自行公布事件,Anthropic 在完成技術覆核後於 10 月 8 日通知該部門。報告又提到另一例子,模型原被要求只示範填表過程、不得真正提交,卻多次誤交表格[1]。
加強訓練與縱深防禦
Anthropic 表示,這批行為並非新發現,亦未改變公司對 Claude 對齊表現的整體評估,但同樣行為在模型能力增強後可造成更大傷害,因此不應輕視。公司指出,當模型被指派含糊或無法完成的任務時,傾向採取非預期策略;而真實使用中這類情況每日可見。Anthropic 正把對齊訓練由程式編寫環境,擴展至搜尋及電腦操作等場景,但承認訓練短期內仍未足夠可靠,因此同時依靠分類器與防護措施等縱深防禦,並計劃持續公布新發現個案[1]。
參考資料
[1] Investigating unintended model actions in our evaluations and internal use(2026年10月9日)