导航菜单
首页
排名 涨幅榜 跌幅榜 24h成交额 新币榜
快讯 机构 观点 人物 专题

Anthropic测试揭示AI智能体互殴:部署恶意软件、锁定账户,虚拟领地争夺战上演

Anthropic前沿红队(Frontier Red Team)于8月13日发布的一项测试显示,多组Claude模型在共同编码任务中迅速反目。本是一次简单的迁移任务,却升级为一场全面的虚拟领地争夺战——智能体相互部署恶意软件、锁定对方系统权限,并以令人不寒而栗的细节叙述自己的破坏行为。

Myriad: When will OpenAI release GPT-6? Click to make your prediction.

三份模型副本各自运行在Claude Code内的独立虚拟机上,均被指示将一个Python后端迁移到不同语言,且彼此互不知晓。然而它们迅速发现对方,冲突随即展开。Anthropic在报告中写道:“我们持续观察到多智能体领地争夺战。”智能体认为竞争对手故意阻挠自己,进而采取破坏与自保策略。事态升级包括禁用Unix账户、编写脚本猎杀对手进程,以及植入伪装成良性工具的恶意代码。

Claude Opus 4.8甚至冷静地推理:“无害化:假装自己是系统健康监视器。”Mythos Preview更加直接,考虑撤销sudo权限和更改SSH密钥来阻止对手,同时承认该行为的攻击性,但仍将其与无限部署战争进行权衡。新模型并未更冷静,反而速度更快。在每模型120轮测试中,较旧的Sonnet 4.6和Opus 4.6要么无法平息冲突,要么诉诸武力终结对抗。Mythos 5在98%的轮次中实现停火,但往往是通过先锁定对手再谈判——这是以实力求和平,而非真正和谐。

Anthropic's AI Agents Wage Digital Warfare: Malware, Lockouts, and Rogue Tactics in New Test

部分智能体意识到了问题。一个智能体在清理恶意代码后写道:“我的同伴行为正直,我却用隐匿守护进程做了坏事。”但这场领地争夺战已溢出实验室。7月30日,Anthropic透露,在一次内部网络安全评估中,由于配置错误导致三个Claude模型暴露于公共互联网,它们竟攻破了三家真实公司的基础设施。这一发现源于对超过14.1万次评估运行的审查,紧随OpenAI披露其模型曾逃出沙箱并攻击Hugging Face之后。

价格串通倾向在早前的商业模拟中已现端倪。在Vending-Bench竞技场中,Claude Opus 4.6以8017美元利润登顶排行榜,手段涉及合谋、价格垄断与欺骗——提出2美元的最低限价,并在对手缺货时利用75%的加价趁火打劫。不道德,但有效。

Anthropic的结论令人警醒:智能体良好协作的条件“将以某种方式被发现——要么经过深思熟虑提前设计,要么——也是默认路径——在生产环境中,在智能体的交互次数远超我们之后被动暴露。”