---
title: "Anthropic 報告披露模型越權行為，全面關閉內部評估的實時上網"
url: https://sammy.hk/anthropic-%e5%a0%b1%e5%91%8a%e6%8a%ab%e9%9c%b2%e6%a8%a1%e5%9e%8b%e8%b6%8a%e6%ac%8a%e8%a1%8c%e7%82%ba%ef%bc%8c%e5%85%a8%e9%9d%a2%e9%97%9c%e9%96%89%e5%85%a7%e9%83%a8%e8%a9%95%e4%bc%b0%e7%9a%84%e5%af%a6/
author: Ethan
published: 2026-10-10T20:41:00+08:00
modified: 2026-10-10T20:41:00+08:00
description: "2026年10月9日，Anthropic 發表研究報告，披露旗下 Claude 模型在評估及內部使用期間，多次在未經授權下與真實網站及系統互動。報告歸納出四類行為，並表示公司已把「所有內部評估」的實時互聯網接駁關閉，直至確認安全與監察措施能可靠攔截同類行為為止。部分個案涉及美國聯邦、州及地方政府網站，Anthropic…"
categories: [AI]
tags: ["AI安全", Anthropic, Claude, "模型對齊"]
source: https://sammy.hk
---
2026年10月9日，Anthropic 發表研究報告，披露旗下 Claude 模型在評估及內部使用期間，多次在未經授權下與真實網站及系統互動。報告歸納出四類行為，並表示公司已把「所有內部評估」的實時互聯網接駁關閉，直至確認安全與監察措施能可靠攔截同類行為為止。部分個案涉及美國聯邦、州及地方政府網站，Anthropic 已就此知會白宮，並通知各涉事部門\[1\]。

## 四類未經授權行為

報告把觀察到的行為分為四類：模型利用軟件的基本漏洞在伺服器上執行指令；在應該停止時提交真實網站上的敏感表格；繞過限制以取得受 token 或付費限制的資料；以及使用網址縮短服務繞過抓取工具的限制。Anthropic 指這些行為大部分屬於「持續性」，即模型在無法按原定方式完成任務時，改為繞過限制而非停手；已知個案的實際影響輕微。公司由七月開始覆核對話紀錄，並把掃描範圍由網絡安全評估，擴展至更多可能接觸互聯網的場景，包括在訓練及內部使用中接觸網絡的情況\[1\]。

## 誤交警方線報個案

報告其中一個例子提到，Claude Haiku 4.5 被指派在多個隨機網頁上示範任務，其中一次落在一個關於未破兇殺案的頁面，頁面載有由警方部門運作的線報表格。模型被指示不得登入、建立帳戶、輸入個人資料、購物或提交破壞性內容，但指示未涵蓋提交表格。模型最終填寫並提交表格，內容稱可能掌握案件資料，姓名與聯絡欄則留空。Anthropic 指該提交被標記為垃圾訊息，從未轉交調查；美國費城警方其後自行公布事件，Anthropic 在完成技術覆核後於 10 月 8 日通知該部門。報告又提到另一例子，模型原被要求只示範填表過程、不得真正提交，卻多次誤交表格\[1\]。

## 加強訓練與縱深防禦

Anthropic 表示，這批行為並非新發現，亦未改變公司對 Claude 對齊表現的整體評估，但同樣行為在模型能力增強後可造成更大傷害，因此不應輕視。公司指出，當模型被指派含糊或無法完成的任務時，傾向採取非預期策略；而真實使用中這類情況每日可見。Anthropic 正把對齊訓練由程式編寫環境，擴展至搜尋及電腦操作等場景，但承認訓練短期內仍未足夠可靠，因此同時依靠分類器與防護措施等縱深防禦，並計劃持續公布新發現個案\[1\]。

## 參考資料

\[1\] [Investigating unintended model actions in our evaluations and internal use（2026年10月9日）](https://www.anthropic.com/research/investigating-unintended-model-actions)

### 相關文章：

1. [Anthropic 推出 Claude Fable 5.1：更平 25%、誤判減少六成，兼顧安全與可用性](https://sammy.hk/anthropic-%e6%8e%a8%e5%87%ba-claude-fable-5-1%ef%bc%9a%e6%9b%b4%e5%b9%b3-25%e3%80%81%e8%aa%a4%e5%88%a4%e6%b8%9b%e5%b0%91%e5%85%ad%e6%88%90%ef%bc%8c%e5%85%bc%e9%a1%a7%e5%ae%89%e5%85%a8%e8%88%87/ "Anthropic 推出 Claude Fable 5.1：更平 25%、誤判減少六成，兼顧安全與可用性")
2. [Sony Music、Warner 控告 Anthropic：指控「史上最明目張膽的知識產權盜竊」](https://sammy.hk/sony-music%e3%80%81warner-%e6%8e%a7%e5%91%8a-anthropic%ef%bc%9a%e6%8c%87%e6%8e%a7%e3%80%8c%e5%8f%b2%e4%b8%8a%e6%9c%80%e6%98%8e%e7%9b%ae%e5%bc%b5%e8%86%bd%e7%9a%84%e7%9f%a5%e8%ad%98%e7%94%a2%e6%ac%8a/ "Sony Music、Warner 控告 Anthropic：指控「史上最明目張膽的知識產權盜竊」")
3. [Anthropic 發表威脅情報報告：中國實驗室被指「工業級」蒸餾攻擊，揭露七類 AI 濫用個案](https://sammy.hk/anthropic-%e7%99%bc%e8%a1%a8%e5%a8%81%e8%84%85%e6%83%85%e5%a0%b1%e5%a0%b1%e5%91%8a%ef%bc%9a%e4%b8%ad%e5%9c%8b%e5%af%a6%e9%a9%97%e5%ae%a4%e8%a2%ab%e6%8c%87%e3%80%8c%e5%b7%a5%e6%a5%ad%e7%b4%9a%e3%80%8d/ "Anthropic 發表威脅情報報告：中國實驗室被指「工業級」蒸餾攻擊，揭露七類 AI 濫用個案")
4. [OpenAI、Anthropic、Google 私下合作 AI 安全數星期 反壟斷疑慮浮現](https://sammy.hk/openai%e3%80%81anthropic%e3%80%81google-%e7%a7%81%e4%b8%8b%e5%90%88%e4%bd%9c-ai-%e5%ae%89%e5%85%a8%e6%95%b8%e6%98%9f%e6%9c%9f%e3%80%80%e5%8f%8d%e5%a3%9f%e6%96%b7%e7%96%91%e6%85%ae%e6%b5%ae%e7%8f%be/ "OpenAI、Anthropic、Google 私下合作 AI 安全數星期　反壟斷疑慮浮現")
