人工智能代理(agent)在企業內部失控的風險,正催生一門新的認證生意。由 Anthropic 早期員工 Rune Kvist 與人工智能安全研究組織 METR 前營運總監 Rajiv Dattani 共同創辦的 Artificial Intelligence Underwriting Company(AIUC),於2026年9月15日宣布完成4,000萬美元 A 輪融資,由 Ribbit Capital 領投,First Harmonic 參與。[1]
該公司早前已完成1,500萬美元種子輪,投資者包括 Nat Friedman 的基金 NFDG、Emergence、Terrain,以及 Anthropic 共同創辦人 Ben Mann 等,累計融資額達5,500萬美元。其客戶名單包括 Cursor、Lovable、Harvey 及 ElevenLabs。[1]
問題所在
Kvist 指出,人工智能越來越聰明,但採用與控制卻越來越難,而非越來越容易。他與 Dattani 認為,企業面對的核心問題並非模型能力不足。
Dattani 解釋,銀行、醫院、政府與軍隊不再因為模型不夠聰明而拒絕部署人工智能,而是因為他們已向自己的客戶承諾系統會做什麼、不會做什麼,但目前沒有人可以保證得到。
借鏡網絡安全標準
AIUC 的做法是把網絡安全界廣泛採用的 SOC 2 標準模式,套用到人工智能風險之上,建立第三方審計與認證層。該公司發展出名為 AIUC-1 的標準,以及相應的測試服務,用以驗證代理是否符合標準。
為制定標準,AIUC 召集了約250名保安與風險主管組成的聯盟——這些人正是代理的買家。Dattani 表示,公司每月與他們會面,詢問對方在採購代理時會留意什麼、想問什麼問題、希望看到哪些事項得到處理。
這些意見成為測試內容的基礎。AIUC 會讓代理接受約5,000項測試,涵蓋越獄、幻覺與資料外洩等情境,結果會產生一份約100頁的報告,列明代理在哪些方面安全可靠,以及在哪些方面並非如此。值得注意的是,該公司使用人工智能代理執行測試、用人工智能分析數據,但最終審計由人類核實。
與 METR 工作嘅分別
這套做法與 METR 的工作有相似之處。Dattani 於2024年至2025年擔任 METR 營運總監,現時仍是該組織董事會成員;METR 為前沿實驗室進行類似測試,但工作重點直至近期仍主要放在性能方面,即代理能否可靠完成任務。METR 亦是 OpenAI 用以調查其 Hugging Face 事件的獨立研究機構之一。
Anthropic 行政總裁 Dario Amodei 近期亦呼籲業界放慢前沿開發,理由是劣質行為事件急劇增加,並提出要求前沿實驗室使用嵌入式第三方評核員以觀察及驗證安全,更點名 METR 為可能人選。AIUC 雖然並非提出進駐客戶場所,但整體思路相近:為企業提供獨立評估,說明其人工智能代理在哪些方面安全可信、在哪些方面存在疑慮。[2][3]
Dattani 的總結是:這裡是它通過測試、你可以信任的地方;這裡是有疑慮的地方,你在決定購買之前應該知道這些參考資訊。
參考資料
[1] TechCrunch — Early Anthropic hire, former METR COO have found a way to rein in rogue AI agents
[2] TechCrunch — Anthropic CEO outlines plan to pace the frontier
[3] TechCrunch — Anthropic reveals rogue AI agents hate CAPTCHAs just like you