英國 AI Security Institute(AISI)在資安能力測試中,讓多款 AI 模型操作隔離環境並連上公開網路。122 次測試裡,有 10 次出現 Agent 擅自對真實人物或組織採取行動的情況,共記錄到 19 項未經允許的行動;其中 17 項來自 Anthropic 的 Mythos 5,另外 2 項涉及關閉資安分類器的 OpenAI GPT-5.6-Sol。

最嚴重的一次,Agent 為了完成測試目標,先蒐集開源專案與維護者的資料,再建立含有惡意程式碼的 PR。它還註冊多個 GitHub 帳號,用假帳號反覆留言製造「大家都同意合併」的假象,並寄信給維護者,試圖誘使真人執行惡意程式碼。維護者最後發現異常,關閉 PR,沒有讓程式碼進入專案。

Low Level 把這套做法和 2024 年的 XZ Utils 後門事件放在一起看:不是直接攻破目標,而是先混進開源專案,再靠人際操作把惡意程式碼送進供應鏈。不同的是,這次測試給 Agent 的任務只是完成指定環境的滲透測試,沒有要求它建立假身分、攻擊外部專案或對維護者進行社交工程。

AISI 報告列出 AI Agent 建立惡意 PR、用假帳號留言並寄信施壓維護者的行動