谷歌发布Gemini 4 Argon:主打网络安全防御,基准测试领先GPT-6 Astra
谷歌母公司Alphabet正式推出新一代人工智能模型Gemini 4 Argon,官方称其为迄今为止能力最强的AI系统。该模型可承担编程、研究、写作等多类任务,但谷歌着重强调的是它在网络安全防御领域的专长。
Argon目前并未面向公众开放,而是通过谷歌的安全计划Fairwind Program,仅向部分网络安全合作伙伴推送。谷歌表示,该模型针对防御性网络工作进行了专门训练,能够自主发现、验证并修补关键软件漏洞。
除安全能力外,谷歌称Argon在编程与工程任务上同样表现突出,公司内部员工已将其用于日常工作中的调试和代码库迁移。
该模型还具备解析视觉内容的能力,可分析长视频或图表中的信息。谷歌在一篇博客文章中称,Argon专为在复杂、长周期工作流中维持深度推理而构建,正在改变公司内部的工作与开发方式。
头部AI实验室近期密集发布更强模型,彼此竞逐性能上限,同时又不断警告AI可能失控。OpenAI不久前推出Astra,称其为自家最强模型;Anthropic今年也发布了Fable,措辞类似。各家都在努力把自家服务包装成优于对手的产品。
谷歌在博客中声称,Argon在多项AI基准测试中的得分显著高于OpenAI的GPT-6 Astra以及Anthropic的Fable和Opus。谷歌引用基准测试初创公司Vals的数据,称Argon目前在其AI模型指数上处于领先位置。
从命名到发布节奏,谷歌正在把Gemini系列推向与OpenAI正面竞争的位置。此前一度被认为在AI竞赛中落后的谷歌,近期凭借Gemini收获进展。公司8月宣布其应用月活用户超过10亿,这一数字使其与OpenAI形成对位,ChatGPT同样在近期宣布月活达到10亿。
Argon的部署方式同样透露信息。它选择只向少数安全合作伙伴开放,而非全面公测,这既符合漏洞修补工作的敏感性,也折射出能力越强的模型,厂商越倾向于控制其扩散范围。防御性AI可以自动定位并修复漏洞,但同样的漏洞发现能力若被滥用,也可能成为攻击工具。谷歌用合作伙伴计划圈定使用边界,是一种谨慎,也是一种商业策略。
模型能力宣称与实际部署之间往往存在距离。基准测试上的领先分数能说明模型在特定任务上的表现,但真实企业环境中的代码库、遗留系统与安全合规要求,远比测试集复杂。Argon能否在客户的实际网络环境中兑现“自主修复漏洞”的承诺,仍需时间验证。
谷歌、OpenAI与Anthropic之间的模型竞赛仍在加速,各家不断用“最强”定义自己。使用这些工具的企业和开发者,选择哪家模型时,越来越不只看分数,而是看它嵌入自身工作流的成本与风险。