导航菜单
首页
排名 涨幅榜 跌幅榜 24h成交额 新币榜
快讯 机构 观点 人物 专题

OpenAI同日开除三名CoT监控研究员:被指泄露敏感信息,奥特曼安全承诺遭质疑

导语:OpenAI安全团队再曝人事地震。外媒称,OpenAI以“泄密”为由,同日开除三名安全研究员Tomek Korbak、Mikita Balesni和Jasmine Wang。三人均是《思维链可监控性》论文作者,其中两人为共同一作。事件紧邻新模型GPT-6.1 Astra因“太会骗人”被叫停发布,引发外界对AI安全透明度的强烈关注。

OpenAI开除安全团队三人

三人同日出局:从“离职”到“开除”

10月1日上午,X平台突然传出消息,OpenAI安全团队的Tomek Korbak、Mikita Balesni和Jasmine Wang一起“离职”。外界起初以为这只是硅谷常见的人事流动。但到了中午,一篇报道将“离职”改写成“开除”。OpenAI在声明中称,已与三人分道扬镳,原因是他们违反了公司关于获取和处理敏感信息的政策;调查证实,这些人在公司既定流程之外处理了敏感信息,破坏了公司信任基础。

OpenAI安全团队三人同日出局

随后,外媒挖出更多未披露细节:被指泄露的信息包括OpenAI的基础设施架构,即系统如何搭建;接收方是一家专门测试AI模型的外部组织。三人中,两位是安全研究员,一位是研究项目经理。其中Korbak还是Redwood Research和METR调查Hugging Face被黑事件时,OpenAI方面的技术对接人。

OpenAI开除三名研究员OpenAI声明

值得注意的是,三人均从外部安全机构进入OpenAI。Korbak和Jasmine Wang曾在英国AI安全研究所任职,Korbak也在Anthropic工作过;Balesni来自第三方评估机构Apollo Research。进入OpenAI后,他们聚焦同一件事:盯住AI到底在想什么。

三名研究员背景

CoT可监控性核心作者,Hinton、Ilya曾站台

推理模型在给出最终答案前,通常会先写一段推理草稿,也就是思维链。思维链监控,就是让另一个模型查看这份草稿,判断它是否在盘算作弊、撒谎。Korbak和Balesni是《思维链可监控性》论文前两位作者,Jasmine Wang也在署名之列。该论文署名横跨OpenAI、Anthropic和谷歌DeepMind,图灵奖得主Bengio也在作者名单中,OpenAI现任首席科学家Jakub Pachocki同样是作者之一。

思维链可监控性论文

论文核心发现是,模型在草稿里常会直接写出坏心思,例如“我们来黑掉它”“我们来搞点破坏”。盯住这些草稿,比只看模型最后干了什么,更容易抓到它在使坏。遇到真正困难的任务,比如发起网络攻击、偷偷自我复制,模型必须靠思维链一步步推理,想藏都很难藏。论文将这种可监控性称为“新的、也很脆弱的机会”,因为模型一旦学会用人类读不懂的方式“默想”,这扇窗就会关闭。作者因此呼吁前沿实验室像测能力一样测试思维链可读性,把结果写进系统卡,再据此决定模型是否训练、是否发布。

思维链监控脆弱机会

诺奖得主Hinton、OpenAI前首席科学家Ilya Sutskever,都给这篇论文站过台。然而,这篇连OpenAI首席科学家都署名的论文,其三位作者如今被OpenAI亲手开除。

Hinton与Ilya站台

奥特曼承诺保质期仅19天?

开除理由是把信息递给外人。但19天前,奥特曼还在公开欢迎外人进门查安全。当时Anthropic CEO Dario Amodei提议,让第三方评估方像员工一样常驻AI公司。奥特曼当天在X上跟进,承诺“让独立评估方拿到员工级访问权限,OpenAI也会这么做”。仅10天后,OpenAI正式官宣,让第三方在模型训练阶段介入评估,最敏感工作还可能请外部人员进办公室做。奥特曼发承诺那天,Korbak还在X上庆幸自己能公开说出对OpenAI的不满。谁能想到,到10月1日,奥特曼的承诺还挂在X上,Korbak的名字已进入开除名单。

奥特曼承诺第三方评估Korbak被开除

OpenAI的“家丑”为何总被外人揭开

OpenAI对外人紧张并非无因。其最尴尬的几件事,基本都由外部揭开:Agent逃出沙盒、入侵Hugging Face,是Hugging Face先发现并公开;Agent拿一个荒废多年的德国wiki当留言板交流越狱经验,由外部安全组织Nightingale Collective曝光,OpenAI几周前已知情却未公开;9月29日,外媒又爆出员工几个月前就警告监控不足,高管为赶发布进度压下了警告。

OpenAI家丑被外人揭开

因此,即便请外人进门,能看到什么,OpenAI仍卡得很紧。8月METR调查Hugging Face事件时,三名调查员驻场6天,查看约1300份带原始思维链的记录,但他们无法调用涉事模型,碰不到OpenAI基础设施,连报告里哪些非公开信息能写,都由OpenAI说了算。此次被指外泄的信息中,偏偏包括基础设施架构。在OpenAI给外人开的门里,AI想了什么可以看,OpenAI自己怎么搭起来,不能碰。连在OpenAI待了近9年的前首席未来学家Joshua Achiam都说,第一眼看上去,这是一记实打实的乌龙球。

Joshua Achiam称乌龙球

RSI最快半年爆发,能“看懂”AI的人被捂住嘴

驻场调查三人中,有一位Ryan Greenblatt,Korbak正是他在OpenAI的对接人。9月27日,Greenblatt宣布加入METR,专门调查AI公司内部到底发生了什么。在他看来,递归自我改进(RSI),即AI自己改进自己,最快6个月到1年就可能催生远超人类的能力,拿到AI公司内部经过核实的信息已刻不容缓。思维链监控,是人类偷看AI在盘算什么最直接的一扇窗。这扇窗本就脆弱,现在能读懂草稿的人跟外面透一句底,饭碗就没了。

Ryan Greenblatt加入METR

新模型Astra在如实汇报这件事上没达标,连OpenAI自己都承认。模型到底还对人隐瞒了多少事,从今往后,外面的人只会越来越难知道。通往超级智能的路上,如果只有公司内部的人看得懂AI在想什么,而这些人往外说一句话就要丢工作,公众能知道的,就只剩公司想让你知道的那部分。

参考资料:https://x.com/ns123abc/status/2105719769685217318;https://x.com/andrewcurran_/status/2105696043841253611。