导语:谷歌周三发布 Gemini 4 Argon,称其为面向编程、办公和网络防御的前沿模型。此次发布距离 Claude Opus 5.5 发布仅一周、距 GPT 6.1 Sol 发布仅一天,显示美国主要 AI 实验室仍在加快推出新系统。
Myriad:Nvidia 会跌到多低?点击做出你的预测。
基准领先,但存在限制
在 DeepSWE v1.1 测试中,Argon 得分 77.9%。该测试衡量 AI 是否能完成冗长、混乱、真实的软件工程任务。Claude Opus 5.5 得分 74.2%,GPT-6 Astra 得分 74.1%,Claude Fable 5.1 得分 67.4%。作为参照,Gemini 3.6 Flash 在 7 月同一测试中得分 49%。
Argon 还能在一次回复中写入最多 100 万 tokens,高于此前的 64,000 tokens,约等于 75 万词,而此前约为 48,000 词。谷歌提醒,比较存在限制:其自行计算 DeepSWE 分数,而竞争对手结果来自公共排行榜和公司报告。谷歌表格还显示,在涵盖编程、科学和计算机控制测试的 18 项基准中,Argon 在 12 项领先、1 项持平、5 项落后。
网络安全能力成为焦点
该模型最突出的功能是网络能力。在 Gray Swan 的间接提示注入基准中,恶意指令被隐藏在 AI 代理读取的内容中,并统计 15 次尝试内攻击成功频率,Argon 为 0.7%,越低越好。Claude Opus 5.5 和 Claude Fable 5.1 均为 1.0%,GPT-6 Astra 为 8.5%。Grok 4.6 和 Kimi K3 被骗概率分别为 51.8% 和 52.7%。
Argon 通过 Fairwind 计划向经过审核的安全团队开放,这是谷歌的有限访问网络防御倡议。Fairwind 于 9 月 2 日启动,已有 650 多个合作伙伴,包括政府和关键基础设施运营商。谷歌称,Argon 不设网络护栏,即通常阻止模型协助黑客攻击的内置拒绝机制。谷歌认为,防御者需要能像攻击者一样思考的模型,以便在犯罪分子发现漏洞前修补,但也承认同一技能具有双刃剑效应。谷歌表示,分阶段推出是唯一安全路径,并正参与美国政府的自愿预发布模型访问流程。
谷歌并非首个将网络重点模型置于受限访问之下的公司。Anthropic 的 Claude Mythos 早期版本曾帮助发现 Firefox 的 271 个漏洞,Mozilla 随后修补。OpenAI 也通过 Trusted Access for Cyber 计划采取类似路线。Argon 的网络分数还超过谷歌随 Fairwind 推出的受限模型 Gemini 3.8 Flash Cyber。在 Wiz 渗透测试基准中,该内部谷歌测试要求 AI 在不见代码的情况下针对真实 Web 应用漏洞编写有效利用程序,并统计首次尝试解决比例,Argon 达到 70.9%,对手为 58.2%。谷歌还称,Argon 帮助安全公司 Wiz 发现全球医院使用的医疗软件中的关键漏洞,而早期前沿模型未能发现。
艰难夏季后,更广泛发布在即
此次发布之前,谷歌经历了一个艰难的夏季。7 月,它发布了较小的 Flash 模型,但跳过承诺的 Gemini 3.5 Pro,Alphabet 股价下跌约 4.4%。Argon 发布同日,美国总统特朗普公布一项自愿、无罚款的 AI 协议,谷歌领导层签署。谷歌表示将尽快更广泛发布,首先面向付费 API 客户和 Google AI Ultra 订阅者。入门价格为每百万输入 tokens 2 美元、每百万输出 tokens 10 美元。谷歌未说明该阶段何时结束,仅表示标准价格为每百万输入 tokens 4 美元、每百万输出 tokens 20 美元。
