Anthropic 發表威脅情報報告:中國實驗室被指「工業級」蒸餾攻擊,揭露七類 AI 濫用個案

Anthropic 於2026年9月10日發表新一份威脅情報報告,披露該公司於2025年12月至2026年8月期間偵測及阻止的惡意使用個案,涵蓋網絡攻擊、影響行動、監控、詐騙、生物武器、常規武器開發及蒸餾(distillation)七個危害領域。報告全文已隨公告一併公開。[1][2] 報告指控多間中國人工智能實驗室以越趨精密的手法,繞過防禦機制提取 Claude 的能力。[1]

攻擊者已由「助手」變成「指揮者」

報告指出,AI 在網絡攻擊中的角色已由單純的問答工具,演變為具備自主執行與協調能力的角色。多數個案涉及多代理框架執行偵察、漏洞利用及數據外洩,人類只負責設定攻擊目標及審視外洩成果。[1]

Anthropic 以代號 GTG-20006 的個案為例,指該攻擊者的手法與俄羅斯國家相關的間諜活動一致。該攻擊者建立以 AI 驅動的自動化流程,涵蓋工具開發、基礎設施購置、釣魚、持續存取及數據外洩;若其部署的惡意軟件被保安產品偵測到,AI 代理會自動修改並重新構建工具,直至不被偵測為止。人類操作者只在需要調整 Claude Code 技能時才介入。[1]

報告強調,過往需要大量專業技術人員及專門知識才能維持的多目標攻擊行動,如今單一黑客或財務動機的個人也能持續進行,「技術複雜程度」已不再是判斷攻擊者背景的可靠指標。[1]

蒸餾攻擊:以代理網絡收集對話記錄

報告的蒸餾部分指控多間中國實驗室未經授權提取 Claude 的能力,涉及 DeepSeek、Moonshot AI、MiniMax 等,以及在報告中具名的商湯科技(SenseTime)。[1]

報告披露的具體手法包括:

  • 商湯科技的蒸餾流程使用從第三方數據供應商購買的 Claude 用戶對話記錄,這些記錄來自透過第三方應用或路由服務存取 Claude 的用戶,被中介機構記錄後轉售;商湯亦用 Claude 撰寫蒸餾流程並啟動及監控訓練
  • MiniMax 透過一間空殼公司建立代理網絡服務,該公司與 MiniMax 無明顯關聯,亦不披露與母公司的關係;該服務只提供 Anthropic 及 OpenAI 的模型存取,不提供任何中國模型(包括 MiniMax 自家模型),顯示其設立目的在於收集用戶與美國前沿模型的對話以訓練自身模型

Anthropic 表示,報告涵蓋的個案中,除一宗蒸餾個案外,並無涉及 Claude Fable 或 Mythos 級別模型。[1]

三層防禦應對蒸餾

Anthropic 指出,應對非法蒸餾並非單一防護措施可以解決,該公司採用分層防禦:以元數據及異常活動訊號識別與代理網絡相關的帳戶,並將可疑活動歸因至特定組織,而非逐一封禁代理帳戶,以便採取更全面的執法行動;同時建立專門偵測對抗式提取的分類器,在確信一組請求與非法蒸餾活動相關時,封鎖請求並封禁帳戶。[1]

該公司亦加入新防護措施:Claude 現在會在回應前先總結其內部推理,令被竊取的對話記錄更難用於訓練其他模型;Fable 5.1 引入「保留思維」(preserved thinking),阻止新的 API 帳戶在多輪對話中修改 Claude 推理前的系統提示、工具或訊息。此外,當系統偵測到潛在濫用訊號(例如未經授權轉售 Claude,或來自在中國、俄羅斯及伊朗等未支援地區運作的帳戶),會要求用戶驗證身份以保留存取權,未能驗證者會被封禁。[1]

參考資料

[1] Anthropic — Detecting and countering misuse of AI: September 2026

[2] Anthropic 威脅情報報告全文(PDF)

發佈留言

發佈留言必須填寫的電子郵件地址不會公開。 必填欄位標示為 *

*