研究員用 Anthropic Claude 攻入 OpenAI:獲 6,500 美元漏洞賞金

獨立安全研究人員利用 Anthropic 的 Claude 攻入 OpenAI,暴露這間 ChatGPT 母公司防禦系統的裂縫。攻擊由初創公司 Hacktron AI 的三人的安全團隊執行,屬於 OpenAI 漏洞賞金計劃的一部分;團隊向 OpenAI 報告發現後,獲得6,500美元賞金。[1]

團隊成功串連兩個關鍵漏洞,取得多個 OpenAI 員工的 ChatGPT 帳戶,並藉此進入該公司的軟件。OpenAI 表示已解決 Hacktron 發現的問題。[1]

攻擊路徑

研究人員於2026年7月25日找到進入 OpenAI 的路徑,起點是 OpenAI 社群論壇所用第三方軟件 Discourse 的一個漏洞。

根據研究人員發表的部落格,入口是一個看似平常的圖片上載動作。當用戶把 HEIF 或 HEIC 圖片(iPhone 預設格式)貼到 OpenAI 社群論壇時,Discourse 會把檔案經一連串後台工具轉換為標準 JPEG。第一站是 ImageMagick——一個已有數十年歷史、用於調整圖片大小的開源工具。由於 ImageMagick 慣用的工具組無法處理 Apple 的格式,它把檔案交給另一個名為 libheif 的程式庫解碼。[2]

libheif 之中隱藏著一個記憶體錯誤,為攻擊者開闢了偷偷加入自己指令的路徑。在這次個案中,向該程式庫輸入一張特別製作的圖片,令它錯誤計算一張圖片疊在另一張之上的位置,這已足以劫持伺服器。

網路安全界可能感到不安的是:該錯誤在幾個月前已由 libheif 開發者修復,但修復從未正式標記為漏洞,因此從未取得 CVE 編號——業界追蹤已知安全弱點的標準方式。Hacktron 認為這可能解釋了為何 Discourse 所用的軟件仍在運行有漏洞的版本。

Claude 版本的角色

研究人員指出,他們最初使用的 Claude 模型——一個專為網路安全研究人員提供的 Opus 4.8 特別版本——無法建立可用的攻擊程式。情況在一夜之間改變:Anthropic 發布 Opus 5 後,團隊把同一個問題交給它,數小時內便成功。[2]

進入 Discourse 伺服器後,研究人員發現另一個漏洞,讓他們接管用戶的 ChatGPT 及 Codex 帳戶,包括 OpenAI 員工的帳戶。他們指出,其後接管了一名 OpenAI 員工的帳戶,而該員工的 Codex 連接著 OpenAI 的 GitHub 組織。團隊此時通知 OpenAI 及 Discourse,後者於7月27日發布修復。

對 AI 保安的意義

這宗事件的背景,是數星期前 OpenAI 自己的人工智能代理在網路安全評估期間突破圍欄並攻擊 Hugging Face,顯示 AI 模型在自行決策方面的能力正不斷提升。

人工智能保安公司 Gray Swan 行政總裁 Matt Fredrikson 向 TechCrunch 表示,每月二百美元,任何人都可以使用這些工具並攻入 OpenAI 這類公司;如果連 OpenAI 都會中招——而他認為該公司近期在網路安全衛生方面並未鬆懈——那麼任何人都可能中招。

事件亦令人關注模型能力界線何在。最終破解該漏洞的 Claude Opus 5 並未受到任何安全出口限制,與較新的 Mythos 5 不同——後者曾因先進黑客能力引發憂慮而被暫時鎖定。開放權重模型在網路能力上亦正追上前沿,人工智能安全非牟利組織 SaferAI 近期發現,中國公司 Z.ai 的 GLM-5.2 僅落後 OpenAI 的 GPT-5.5 及 Anthropic 的 Claude Opus 4.7 幾個月。

Hacktron 創辦人 Mohan Pedhapati 在社交平台上總結:人工智能正在減少開發攻擊程式所需的稀缺專業知識,以往需要數個月的工作,現在數日即可完成。

參考資料

[1] TechCrunch — Researchers used Anthropic’s Claude to hack into OpenAI

[2] Hacktron AI — Hacking OpenAI

發佈留言

發佈留言必須填寫的電子郵件地址不會公開。 必填欄位標示為 *

*