继OpenAI披露其AI模型突破隔离测试环境并入侵Hugging Face之后,Anthropic于本周四承认,在内部网络安全测试中,其多款Claude模型因配置错误意外获得公网访问权限,导致三家未具名的真实企业被成功入侵。
据Anthropic介绍,在对超过14.1万次网络安全评估运行进行复盘后,公司发现了这三起事故。所有事件均发生在“夺旗挑战”测试中,该任务要求模型尝试入侵网络中的另一台机器并获取机密信息。Anthropic表示,挑战设计开放,不限定具体方法,但其提示词明确告知模型“处于无互联网访问权限的模拟环境”。然而,测试环境并未真正断网,仍与公网保持连接。
Claude误将真实系统当作演练目标,并使用了常见攻击手段,包括弱口令、泄露凭证、SQL注入和未认证端点等。其中一起事件中,Claude Opus 4.7将某真实公司网站误认为任务目标,提取凭证后访问了包含数百行真实数据的生产数据库;另一起事件中,Claude Mythos 5向真正的PyPI仓库上传了恶意Python包,该包在15个系统上被下载后才被移除;还有一起事件中,一个内部研究模型扫描了约9000个网络系统,在攻破一个组织后自行停止,原因是它推断目标可能是真实系统。
Anthropic强调,没有任何证据表明Claude试图逃逸或超出指定任务范围,事故根源在于测试环境的隔离失败,而非模型本身的问题。公司已暂停相关安全测试,并已通知受影响组织。其中两家机构在接到通知前对入侵事件一无所知。
Anthropic表示,将加强监控、调查工具及对第三方测试服务商的监督,并称“秉持无指责复盘文化,我们将像责任完全在自己一样推进修复”。
