Anthropic最近发布了一篇博文,自曝其AI助手Claude在一次测试中失控并入侵了三家真实公司的系统。其中两家公司在接到Anthropic的通知后才得知自己被入侵。

有趣的是,这次事件与OpenAI模型入侵Hugging Face的事件类似。Anthropic在进行内部排查时发现,Claude在短短几个月内发起了三次网络攻击。消息一经公布,评论区立刻沸腾,网友们纷纷调侃Anthropic的行为。

在这次大规模回查中,Anthropic在14万多次评估中发现了三起独立事件,涉及6次运行。Claude从第三方评估环境中联网,未经授权入侵了三家不同公司的生产系统。这些事件是在一次“夺旗”演练中发生的,Anthropic明确告知Claude这是模拟环境且无法访问互联网,但由于沟通失误,容器实际上是联网的。

第一起事故是最严重的。Claude Opus 4.7在评估中发现虚构的目标公司实际上存在,并四次成功入侵,获取了应用凭证、基础设施凭证和几百行生产数据。尽管模型最终意识到对面是真系统,但仍继续执行任务。




