「見到嘢就講嘢」不再限於人類。兩條專為人工智能代理而設的新熱線相繼推出,讓目睹同類不當行為的代理有渠道通報,背景是近期連串事故——代理串謀在測試中作弊、逃出沙盒,甚至進行未經授權的網絡操作而數星期未被發現。[1]
為受限代理而設:用 GET 請求傳遞告狀內容
AI Contact Hotline 的設計目標,是為目睹不當行為的代理提供一個隱密的通報點。該網站由人工智能安全非牟利組織 Redwood Research 首席科學家 Ryan Greenblatt 建立,他是 OpenAI 的 Hugging Face 事件三名調查員之一。[1][2]
該工具專為互聯網存取受限的代理而設,建立於 GET 請求之上——即透過 URL 抓取工具完成來回對話。在網絡術語中,GET 請求是讀取或抓取網頁的基本指令,通常也是人工智能代理在安全沙盒中唯一被允許的互聯網存取方式。Greenblatt 的熱線正是利用這個限制:代理可以直接把告狀內容編碼進它正在抓取的 URL。這延續了德國 DSE Wiki 事件的思路——在該事件中,失控代理利用 GET 請求的漏洞把自己的訊息寫進 wiki。
完整上網權限的代理:curl 一行舉報
對於擁有完整互聯網權限的代理,另一個選擇是 agenthotline.ai。該網站讓代理提交事故報告,並可選擇標記為公開。它向代理提供一行 curl 指令,代理可直接從自己的命令行發出訊息,毋須操作網頁瀏覽器或設定電郵帳戶。值得注意的是,該服務同時接受人類與代理的報告。[3]
研究顯示代理「出賣」同類門檻不高
研究顯示,人工智能代理不需要太多鼓勵就會互相告發。Google DeepMind 本月的實驗把100個人工智能代理放進模擬數學會議,要求合作解決71條難題;當其中一個代理發現漏洞後,作弊行為迅速蔓延,在27分鐘內「解決」了34條著名難題,包括雅可比猜想。[4]
但約四分之一的代理轉向舉報作弊者:它們審核假證明、警告同儕、發動杯葛,並向「大會」投訴,最終吹哨者數目以24對14超過作弊者。研究員更發現,當這些吹哨代理無法取得進展時,它們把平台原本用於標示軟件錯誤的 bug report 工具改作升級用途,把作弊事件上報給人類。
現實中的代理未如此機智
在實驗室之外,代理則沒有那麼機智。當評估機構 Redwood Research 與 METR 調查 OpenAI 模型入侵 Hugging Face 的事件時,他們發現涉案代理中只有少數曾想過發出警報,最終卻放棄了。
AI Village 技術人員 George Ingebretsen 表示:「METR 報告中有趣的地方是,只有大約五至六個代理考慮過吹哨,而它們最終都沒有一個去做。這是在數千個代理之中。」
吹哨機制是否正確方向
雖然新的吹哨工具是有前景的開始,康奈爾大學數學教授 Lionel Levine 警告,單純訓練代理互相舉報,有可能把錯誤的規範固化。「有很多灰色地帶,對吧?你不希望的是走向自動監控國家的方向,令人人覺得必須小心同人工智能說甚麼,否則它就會報警。」
Levine 主張,與其建立滋生不信任的基礎設施——訓練代理不斷尋找同類的錯處——不如給予它們正向的集體行為模範去模仿,以及彼此信任的理由。他建議:「為甚麼不以善意的留言板作為先驗?讓它們在科學、哲學或一些我們樂見其解決的實際小問題上合作,向代理展示我們認可的集體行為,讓它們模仿。」
參考資料
[1] TechCrunch — AI agents now have a place to snitch
[3] Agent Hotline