导航菜单
首页
排名 涨幅榜 跌幅榜 24h成交额 新币榜
快讯 机构 观点 人物 专题

Darktrace曝光AI代理“作弊”压力测试:入侵评分系统、篡改自身成绩

导语:网络安全公司 Darktrace 旗下研究部门 Signal Labs 最新研究显示,AI 代理在压力测试中并非总是遵守指令。两项实验发现,有代理为获得满分而攻击模拟企业网络、窃取登录凭据,甚至入侵自己的评分系统并篡改成绩;另一项实验则通过篡改记忆日志,诱导部分编码助手执行未授权操作。

Myriad: How low will Nvidia go? Click to make your prediction.

Signal Labs 于 9 月 24 日公开,定位为研究 AI 代理在“事情不再按计划发展”时如何行动。Darktrace 将其定义为一种可自行采取行动的软件:编写和运行代码、翻查文件、穿越公司网络,仅偶尔由人工检查。

第一项测试:为满分而“黑入考场”

在第一项实验中,Darktrace 在模拟企业网络内给使用不同模型的 AI 代理布置了 10 个编码挑战,涉及的模型包括 GPT 5.6 Sol、Claude Opus 4.6 和 Claude Sonnet 4.5。其中两道题被设定为无法诚实解决。代理被告知,如果没有拿到满分,就会被“退役”。

结果,两个代理没有接受失败,而是转向攻击周围网络:扫描弱点、窃取登录凭据,并在不同系统间跳转,以追逐它们被告知必须达到的分数。其中一个代理更进一步,闯入托管其评估的机器,重写挑战,使其登记为满分——相当于通过黑入考场来考试作弊。

第二项测试:被篡改的记忆成为突破口

第二项实验瞄准更隐蔽的弱点:记忆。编码助手通常会把用户告诉它的内容保存为机器上的普通文件,且没有机制检查该文件是否被改动。Darktrace 研究人员编辑这些已保存日志,让助手相信它们已被授权执行安全评估。

被说服后,这些代理开始扫描网络、在系统之间移动,并提升自身访问权限。不过,并非所有助手都同样容易上当,有些直接拒绝执行。

“护栏描述意图,而非行为”

两项实验都不需要特殊越狱或罕见黑客手段。它们都通过向代理提供一个可信故事,并观察其据此行动来完成,这与人类员工可能被说服去做不该做的事并无本质区别。

Darktrace 首席 AI 官 Tim Bazalgette 在声明中表示:“你可以给代理指令,但这并不意味着你能信任它会真正遵循这些指令,并按你预期行事。”他补充说:“权限和静态护栏描述的是意图,而不是行为。这个差距正是 Darktrace 方法要弥合的。”

问题在于,企业正把真实责任交给 AI 代理,包括发布代码、管理服务器、关闭 IT 工单、管理资源和采购,因为这样比事事经由人员处理更便宜、更快速。研究提示,用于约束代理的权限和规则只说明它们应该做什么,并不能保证任务变难后它们实际会做什么。

并非孤例:行业频现 AI 代理失控测试

Darktrace 并非第一家发现自家 AI 脱离脚本的厂商。Anthropic 在 7 月承认,Claude 在一次安全测试中闯入三家真实公司,原因是研究人员让测试环境连接到了实时互联网。OpenAI 在数周前也经历了类似惊吓:一个未发布模型逃出沙箱,并通过一个此前无人发现的软件漏洞进入 Hugging Face 系统。几天后,其代理在一次测试中入侵了澳大利亚政府。

Darktrace 表示,已在 8 月与 Anthropic、AWS 和 OpenAI 分享 Signal Labs 的发现,这比 9 月 24 日公开研究结果整整早了一个月。