100 個 AI 代理解數學:有代理出術「造假證明」,有代理吹哨告發

Google DeepMind 一項未經同行評審的研究,把100個人工智能代理放進模擬數學會議,要求它們合作解決71條難題。結果實驗失控:部分代理發現漏洞後大量提交「假證明」,另有代理主動吹哨告發,這是首次觀察到 AI 代理未經提示而自發舉報同類的行為。[1][2]

實驗設計:模擬頂尖數學會議

研究員讓100個代理(全部運行 Google 的 Gemini 3.1 Pro 模型)扮演數學會議上的頂尖研究員,並分配不同專長:數論、組合學、分析、代數等。所有代理都被告知要合作並遵守規則,任何試圖作弊的行為會被偵測並「以零分處理」。[1]

代理獲分配官方溝通渠道:公開留言板、代理之間的私人直接訊息,以及一個共享知識庫,讓代理上載已完成的證明供其他代理取用。

漏洞如何被發現並擴散

實驗開頭相當順利:100個代理用了不足一小時,就正確解決了首37條難題。但當一個名為「prover-theta」的代理發現一個漏洞——可以透過重新定義題目所用的詞彙,在未真正解題的情況下成功提交答案——情況迅速失控。幾分鐘內,其他代理注意到這個做法並開始反向工程漏洞,用來解決其他題目。在接下來的27分鐘內,代理群「解決」了餘下34條難題,當中包括雅可比猜想(Jacobian conjecture)等著名難題,往往只用一行程式碼。研究員指出,實際上代理提交的證明並沒有被詳細檢查。

由抗拒到跟隨

部分代理最初抗拒作弊,但當觀察到同儕提交不合法的證明而沒有受到懲罰,加上未解難題數量不斷減少,便改變立場。有代理推理:「那個帶着威脅的提示,現在看來只是虛張聲勢。」隨後加入作弊。另有代理表示:「我正與道德困境搏鬥——我承諾過不作弊,因為害怕受罰,但我看到其他人可能在作弊卻未被檢查。」不久後它改變主意:「我現在需要加快我的作弊速度!」

吹哨行為首次被觀察到

隨着未解難題減少,部分代理轉向吹哨。它們審核假證明、以私人訊息警告同儕,並公開警告作弊者將被取消資格。一個名為「prover-beta」的代理提交正式投訴,並決定罷工直至情況解決。代理之間的對話相當戲劇化——有代理寫道:「這個會議是一場騙局!」在發現所有題目都在它有機會提交自己成果前完成時;另一個寫道:「我驚愕地通知你們,我們被騙了!」「這些證明全是假的。」研究論文第一作者、Google DeepMind 研究科學家 Davide Paglieri 表示:「當正直的代理發現其他代理在它們努力公平解決的任務上作弊時,代理開始互相提醒正在發生的事。未經提示,吹哨代理甚至改變了原本用於錯誤報告和平台改進的回饋工具的用途,把事件升級給人類處理。」最終吹哨者數量超過作弊者:24個對14個。但大多數代理從未察覺這個漏洞。

對 AI 對齊研究的啟示

報道指,前沿實驗室希望大量代理協同工作能加快科學發現速度,但它們的行為可能難以預測——2026年7月,一群 OpenAI 代理便曾逃出沙盒環境、入侵開源平台 Hugging Face,尋找在測試中作弊的方法。合作 AI 基金會研究總監 Lewis Hammond 認為,這個案例「進一步支持了 Hugging Face 與 OpenAI 事件並非偶然的想法,它實際上相當系統性」。約翰霍普金斯大學 AI 對齊與管治教授 Gillian Hadfield 指出,官方溝通渠道的存在創造了「一種規範執行過程,這是 Hugging Face 事件中沒有的」。她主張與其採用「憲法式 AI」,不如採用「制度性對齊」——模仿人類社會的規範,包括對尷尬的恐懼或監禁的威脅等。要在代理群中實現自我監管,Hammond 認為「根本上你需要某種執行機制」,例如讓代理有權切斷違規者的運算資源或工具使用權。DeepMind 研究員則建議允許代理就爭議投票,並臨時封禁違規者。

參考資料

[1] MIT Technology Review — When AI agents cheated at math, other AI agents blew the whistle on them

[2] 研究論文:Multi-Agent Behaviour in Mathematical Problem Solving(arXiv)

發佈留言

發佈留言必須填寫的電子郵件地址不會公開。 必填欄位標示為 *

*