发生了什么
谷歌在官方博客发布新一代前沿模型 Gemini 4 Argon,由 Google DeepMind 高级副总裁兼首席 AI 架构师 Koray Kavukcuoglu 署名。谷歌把该模型定位为面向长周期、复杂工作流的深度推理模型,覆盖真实软件工程、法律与金融等企业知识工作,以及网络安全防御三类场景。
- 输出 token 上限由前代 Gemini 的 64K 提升至 100 万,谷歌称这是业内最长的输出上限,使模型可在单条轨迹内生成数十万 token 并保持推理连贯。
- 在衡量长周期软件工程任务的 DeepSWE v1.1 上得分 77.9%,高于谷歌图中给出的 Claude Opus 5.5(74.2%)与 GPT-6 Astra(74.1%);企业流程自动化基准 AutomationBench 得分 51.3%。
- 长视频理解基准 LVBench 为 91.7%;在漏洞修复基准 CWE-bench v1 上与另一模型并列第一,得分 68%。
- 首发优惠定价为每百万输入 token 2 美元、每百万输出 token 10 美元,缓存输入在此基础上再降 95%;优惠期结束后恢复到输入 4 美元、输出 20 美元。
谷歌给出的内部成绩
谷歌称 Argon 已在公司内部投入使用,并列出三类结果。量子计算研究中,模型帮助优化子程序的时空资源(量子比特乘以量子门),在一个案例中数分钟内比已公开基线提升 40%;数据中心内存优化方面,Argon 智能体分析全集群性能遥测并自主应用优化,上线后释放超过 300 TiB 内存,预计总节省规模为 500 TiB 至 1 PiB;代码迁移方面,Argon 智能体正把谷歌内部 C/C++ 代码库改写为 Rust,规模从 re2、libgav1 等核心库的几万行,到 Fuchsia Zircon 内核的 80 万行以上。
- 以 libgav1 为例,Argon 智能体在已有 Rust 移植基础上替换 3.2 万行 SIMD 代码,通过多轮基于性能剖析的实验与编译器输出分析,产出可由编译器自动向量化的安全 Rust,最终解码器比原 Rust 移植版快 2.7 倍且视频输出一致。
- 谷歌强调这类大规模改写在上线前仍须经过自动化与人工审计、仿真测试与层层代码复核。
为什么重要
对企业的直接含义有三点。其一,前沿模型的竞争维度正从单轮问答转向「单次任务能连续推进多久」,100 万输出上限与企业流程自动化基准,说明厂商开始按交付工作量而不是 token 数量讲故事。其二,定价明显进攻:优惠期内 Argon 约为 GPT-6 Astra 官方价的五分之一、Claude Opus 5.5 的一半,优惠期后与 Opus 5.5 持平。其三,谷歌把安全能力与发布节奏绑定——模型参与美国政府模型发布前自愿评估流程,并通过 Fairwind 计划优先交给政府、关键基础设施与技术平台的防御方,且在面向防御方的版本中不设网络安全护栏。
不确定之处
需要区分厂商自报与独立复现。上述基准与内部案例均来自谷歌发布材料,尚未见到第三方在同等设置下的复现结果。更关键的是可用性:Argon 目前不面向公众开放,付费 API 客户与 Google AI Ultra 订阅者「尽快」获得访问权,但没有给出日期。这意味着在优惠价窗口内,多数企业事实上无法验证这些成绩能否转化为生产成本下降。此外,自主挖掘与修补漏洞的能力被交给防御方且不设相关护栏,这类能力的可控边界目前缺少公开评测口径。

