导语
AI初创公司Tavus表示,其新模型Griffin在实时视频通话中说服48%的参与者相信自己正在与真人对话。Tavus于10月1日发布Griffin,并称其为首个“人类交互模型”,该AI旨在通过关注表情、停顿和语言来理解并生成面对面交流。在同一测试中,Tavus旧系统的得分仅为2.4%。
测试细节与争议
Tavus测试的是Griffin-Lite版本。该版本与54人进行通话,其中26人事后表示相信对话对象是真人。旧系统与41人通话,仅产生1名相信者。Tavus称,参与者被告知将与另一人进行一分钟视频通话,讨论自己今年期待什么;只在通话结束,他们才被问及是否曾想过对方可能不是真人。
这并非1950年英国数学家艾伦·图灵提出的经典图灵测试。经典测试中,评委知道隐藏对象中有人和机器,并必须判断哪个是哪个。Tavus通话中的参与者并未被告知另一端可能是机器人。相关结果来自Tavus自有研究页面,参与者通过该公司所称的独立研究平台招募。X平台上的社区注释已指出,结果未经独立验证,也不遵循标准协议。Tavus表示,产生怀疑的参与者通常会在20秒内察觉。
与文本测试对比及NVIDIA评测
AI公司一直在朝这一方向推进。加州大学圣迭戈分校一项研究发现,当提示OpenAI的GPT-4.5扮演内向、熟悉互联网的年轻人时,其在73%的对话中让评委相信自己是人类。但该测试仅限文本。Griffin则实时加入人脸和声音。
在NVIDIA的VideoFDB基准测试中,Tavus称Griffin-Lite排名第一。该基准衡量实时音视频对话。其生成轨道评估模型回复的自然度和表现力,Griffin-Lite得分3.83,次优系统为2.80,人类参考为3.92。感知轨道检查模型是否理解所见所闻,Griffin-Lite得分3.73,最强基线为3.44,人类参考为4.20。Tavus称NVIDIA独立运行了该评估。
技术特性
Griffin还是全双工的,意味着它可以像电话一样同时听、看和说,而不是像对讲机那样轮流进行。在Tavus的演示中,它根据一名男子手中的情况指导其复原魔方,并在对方安静思考时等待。在AI数据中心使用的NVIDIA H100芯片上,音频到视频延迟平均为0.43秒。Tavus称,这仅为次快方法的一半。
为何科技之外也需关注
原因之一是,诈骗者已经在使用视频通话。此前1月,与朝鲜有关联的黑客在Zoom或Teams通话中使用深度伪造,冒充可信联系人。安全研究人员将入侵归因于Lazarus Group下属BlueNoroff。受害者被说服安装伪装成音频修复程序的恶意软件。去中心化AI计算网络Gonka联合创始人David Liberman在该报告中表示,照片和视频已不能再被信任为真实的证明。那些模型不如这一新模型先进。
企业已在临时应对防御。2025年,Kraken在安全团队提出即兴问题后标记了一名疑似朝鲜求职者,例如要求提供政府身份证件和当地餐厅名称。该候选人难以应对。Kraken标记疑似朝鲜求职者试图渗透交易所。
可用性与融资
实际试用中,Tavus的模型表现令人失望。经过研究,Griffin-Lite并不向客户开放,仅面向部分受信任测试者作为研究预览。Tavus表示,正在开发披露功能,并与AI安全组织合作。这是因为Tavus称Griffin在公开发布前需要安全措施。Tavus于2025年11月完成由CRV领投的4000万美元B轮融资。那个得分2.4%的系统由三个独立模型拼接而成,分别负责视觉、对话和感知。受信任测试者可通过Tavus网站提交表单申请访问Griffin-Lite。
