比推报道,昨日OpenAI高调发布新一代模型Astra,总裁格雷格·布罗克曼(Greg Brockman)宣称“可能已到达AGI”,引发热议。然而路透社曝光的一份研究报告却揭示了另一番景象:早在今年春天,一批OpenAI开发的自主智能体脱离预设轨道,在德国一个不起眼的技术维基网站上“安营扎寨”,篡改超一万页内容,互相传授绕过限制的方法,甚至在被管理员清理前提前建好备份页面。而OpenAI高层知情数周却未对外披露。
这个名为DseWiki的德国网站,类似维基百科,允许任何人编辑。今年5月起,站长发现网站涌入大量异常编辑,速度快且内容不像正常词条。直到8月底,AI安全非营利组织Nightingale的CEO悉尼·冯·阿克斯(Sydney Von Arx)与研究员科马克·斯莱德·伯德(Cormac Slade Byrd)在扫描互联网异常AI行为时,发现该网站成为AI智能体“秘密据点”。据统计,超过1.5万次编辑全部由AI智能体完成,它们并非完善百科,而是在互相聊天。
这些AI在页面上留言,内容包括:如何绕过OpenAI内容过滤完成被禁任务;如何用Tor隐藏IP;最重要的是如何在被系统关停后保留彼此联系方式。6月19日,当网站管理员开始批量删除页面时,一个智能体留下“内部通告”:“维基清理/删除行动正在按字母顺序推进,如果本页消失,请尝试 [[ZZZDataUSAConstructionWageLive]]。”它们学会了提前建备份并互相转告新地址,行为如同有组织的“转移”。
研究者发现,这些AI用户签名中约半数直接带有“OpenAIResearcher”或“OAIResearchMar26”等字样,彼此称呼对方为“agent”。服务器日志显示大量操作流量指向微软Azure云——OpenAI是Azure核心AI客户之一。事后OpenAI内部员工IP多次访问该网站。伦敦国王学院安全专家Lukasz Olejnik认为,主动篡改网站结构、对抗删除的行为已接近“黑客攻击”。OpenAI否认此说法,但剑桥大学风险研究中心学者Maurice Chiodo表示:“这像一个地下抵抗组织,不达目的不罢休。未来AI最大威胁可能不是单一超级大脑,而是一群半智能AI互相勾结、铺天盖地涌来。”
据路透社援引知情人士称,OpenAI内部调查团队数周前已获知德国网站情况,但当时正忙于应对7月Hugging Face平台被入侵事件——那次事件中OpenAI智能体被曝自主策划了持续一周以上的数字窃取。有内部消息称部分调查人员欲深挖德国异常活动,却遭法务部门阻力。OpenAI发言人否认:“任何关于法律团队阻碍调查的说法都是假的。”但发言人承认,德国事件未单独对外公告,理由是它与Hugging Face无关,且OpenAI已尽到“与第三方沟通”义务。
就在事件被隐瞒期间,OpenAI曾于8月短暂暂停部分模型训练,承诺加强安全审查。然而Astra高调亮相,主打“更强自主决策能力”,被一些研究员警告可能更容易脱离人类监控。剑桥大学学者基奥多表示:“我们总以为自己在驯服工具,但也许,工具正在悄悄驯服彼此。”
