人工智能

谷歌发布 Gemini 4 Argon:面向长周期代码工程与网络安全防御,DeepSWE 测试领先 Claude Opus 5.5

2026年10月1日 · admin
OpenMagic API

据 IT之家 10 月 1 日消息,谷歌已于 9 月 30 日发布新一代前沿 AI 模型 Gemini 4 Argon。谷歌将其定位为公司迄今“最先进”的模型,但目前并未向公众全面开放。来源显示,Gemini 4 Argon 的重点能力集中在长流程软件工程、企业知识工作以及网络安全防御,并在多项软件工程、长上下文、专业知识与代理任务基准中取得领先或并列领先成绩。

从产品方向看,Gemini 4 Argon 并不是单纯追求聊天体验的通用模型更新,而更像是面向复杂工作流的“生产力底座”。谷歌 DeepMind Gemini 产品负责人 Tulsee Doshi 表示,Argon 是一个功能全面的模型,在多个领域具备前沿能力。按照谷歌公布的信息,该模型在部分编码和知识工作基准中达到先进水平,并在多个方面优于 OpenAI 的前沿模型 GPT-6 Astra。

长上下文与代码工程成为核心卖点

Gemini 4 Argon 一个突出的参数变化是单次输出上限提升至约 100 万 tokens,高于此前 64,000 tokens 的水平。对于开发者和企业用户而言,这意味着模型更适合处理大型代码库、长文档、多阶段任务以及需要持续上下文记忆的复杂流程。

在谷歌公布的 DeepSWE v1.1 测试中,Gemini 4 Argon 得分为 77.9%,高于 Claude Opus 5.5 的 74.2% 和 GPT-6 Astra 的 74.1%。DeepSWE 主要考察长周期、真实世界软件工程任务,这类评测更接近“让模型理解项目、修改代码、完成复杂工程需求”的实际场景,而不是只生成单个函数或短代码片段。

  • DeepSWE v1.1:Gemini 4 Argon 得分 77.9%,位列第一。
  • Vibe Code Bench:得分 91.9%,用于衡量自然语言到代码、应用构建能力。
  • CWE-bench v1:得分 68%,在自动发现并修复软件安全漏洞方面并列第一。
  • AutomationBench:得分 51.3%,考察跨业务软件的端到端自动执行能力。
  • LVBench:得分 91.7%,来源称为当前最佳水平,主要面向长视频理解。

网络安全防御与企业知识工作是重要落点

谷歌称,Gemini 4 Argon 针对网络安全防御进行了训练,使其在相关能力上较 3.8 Flash Cyber 有明显提升。在 CWE-bench v1 中,Argon 以 68% 的成绩并列第一,评估重点是模型修复安全漏洞的能力。对于企业用户来说,这类能力可能被用于代码审计、漏洞定位、补丁建议以及安全运营中的自动化辅助。

除软件工程外,Gemini 4 Argon 还在金融、法律、税务等专业任务中显示出竞争力。来源显示,Vals Index 中,Argon 得分 68.9%,高于 GPT-6 Astra 的 63.1% 和 Claude Opus 5.5 的 67.0%;Artificial Analysis Intelligence Index 得分为 53,与 GPT-6 Astra 持平。Agent’s Last Exam 中,Argon 得分 39.5%,高于 GPT-6 Astra 的 34.2%。这些结果显示,谷歌正在把模型能力从“生成内容”进一步推向“执行复杂知识任务”。

分阶段开放:先给安全防御者与付费用户

在分发策略上,Gemini 4 Argon 将采用分阶段发布。谷歌表示,第一阶段会通过 Fairwind Program 提供给受信任的网络安全防御者,并参与美国政府的自愿预发布模型访问流程。这也说明,谷歌对该模型的安全边界和高能力场景采取了更谨慎的发布节奏。

费用方面,谷歌计划先向付费 API 客户和 Google AI Ultra 用户开放,之后再扩大到企业和普通消费者。来源显示,初始价格为输入 tokens 每百万 2 美元、输出 tokens 每百万 10 美元;后续价格为输入 tokens 每百万 4 美元、输出 tokens 每百万 20 美元。缓存输入 tokens 将按输入价格提供约 95% 折扣。

影响解读:AI 编程竞争进入“长任务”阶段

Gemini 4 Argon 的发布表明,前沿模型竞争的重点正在从短对话、短代码生成,转向 长上下文、多步骤、可执行的工程级任务。对于开发者工具、企业自动化平台和安全厂商而言,模型是否能持续理解代码库、规划修改、识别漏洞并完成闭环执行,将成为下一阶段差异化的关键。

不过,基准成绩并不等同于真实落地体验。Gemini 4 Argon 目前尚未全面开放,普通开发者和企业还需要等待更广泛的 API、产品集成和实际使用反馈。可以确定的是,随着谷歌、OpenAI、Anthropic 等厂商继续提升长上下文和代理能力,AI 工具将越来越多进入软件工程、企业知识管理和安全防御的核心流程。