Gemini 4 Argon 问世:网络安全性能碾压竞品,谷歌开启受限访问
核心要点
谷歌推出旗舰Gemini 4 Argon,在DeepSWE基准及间接提示注入防御测试中表现优异。该模型通过Fairwind计划向650+机构开放,旨在辅助网络防御,定价优惠期已启动。
据 Woofun AI 消息,谷歌于周三正式推出其最新旗舰模型 ,将其定位为系列中最强大的产品,核心聚焦于编程、办公任务及网络防御领域。
这一发布节奏紧随竞品步伐,在 发布一周后、 发布一天后亮相,折射出行业在加速迭代与合规审慎之间的微妙平衡。
在衡量复杂软件工程能力的 基准测试中, 以 77.9% 的得分率确立领先优势,超越 Claude Opus 5.5(74.2%)、(74.1%)及 Claude Fable 5.1(67.4%)。相比之下, 在 7 月进行的同一测试中仅得 49%。生成能力方面,Argon 单次回复上限提升至 100 万个 token,较此前 64,000 个 token 的限制大幅扩容,相当于从约 48,000 个单词跃升至 750,000 个单词。
Woofun AI 整理数据显示,尽管谷歌自测数据存在偏差风险,但其在 18 项涵盖编程、科学及计算机控制的基准测试中,仍有 12 项领先、1 项持平、5 项落后,整体性能提升显著。
网络安全专项表现成为 Argon 的核心差异化优势。在 组织的间接提示注入基准测试中,通过 15 次隐藏恶意指令的攻击尝试,Argon 的成功率仅为 0.7%,远低于 Claude Opus 5.5 和 Claude Fable 5.1 的 1.0%,以及 GPT-6 Astra 的 8.5%; 和 则分别高达 51.8% 和 52.7%。在谷歌内部 渗透测试中,Argon 在不查看代码的情况下针对真实网页应用缺陷编写有效攻击代码的首次解决率为 70.9%,优于受限版本 的 58.2%。
此外,Argon 还协助安全公司 Wiz 发现了全球多家医院使用的医疗软件中的一个严重漏洞,而此前某些先进模型未能识别该风险。
分发策略上,Argon 通过 9 月 2 日启动的 Fairwind 计划向经过审核的安全团队交付,目前已有包括政府和关键基础设施运营方在内的 650 多家机构参与。该模型没有内置任何网络防御机制,即缺乏通常用于防止黑客攻击的自动拒绝功能,旨在让防御方能像攻击者一样思考以提前修补漏洞。鉴于潜在滥用风险,谷歌采取分阶段推出策略,并参与美国政府推出的自愿审批流程。此举对标 的 (曾助 修复 中 271 个安全漏洞)及 的可信访问网络防御计划。
商业落地方面,首批用户为付费 API 客户及 订阅者,优惠期定价为每百万输入 token 2 美元、输出 token 10 美元,正常标准分别为 4 美元和 20 美元。此次发布正值 股价因 7 月未如期推出 而下跌 4.4% 之后,同日特朗普总统宣布自愿性人工智能协议,谷歌高层亦参与签署,标志着行业在监管与技术创新间寻求新平衡。

评论
暂无评论