返回行业动态
模型与产品

xAI 发布旗舰模型 Grok 4.7:底座换新但单价维持 2 美元 / 6 美元,Terminal-Bench 4.0 接近翻倍

2026 年 9 月 21 日,xAI(对外亦称 SpaceXAI)发布 Grok 4.7,定位其面向编程与知识工作的最强一代模型,即日起在 Cursor、Grok Build、xAI API 与多家第三方编码框架同步上线。新模型换用比 Grok 4.6 更大的底座,延长强化学习训练,任务难度权重向需要数小时完成的长程问题倾斜。定价保持每百万 token 输入 2 美元、输出 6 美元不变,超过 20 万 token 的请求按 4 美元 / 12 美元计费,另有速度与价格均翻倍的 fast 版本;上下文 50 万 token。厂商自测显示 CursorBench 4.0 由 40.4% 升至 46.3%,Terminal-Bench 4.0 由 20.3% 升至 38.0%,Harvey 法律智能体基准由 15.8 升至 19.6;但多个榜单仍落后于竞品,且全部成绩均为厂商自行发布,尚无独立复现。

来源:SpaceXAI(原 xAI)官方发布与 Grok 4.7 模型文档原标题:Grok 4.7查看原文
深色数据中心内成排高密度推理服务器机柜沿纵深延伸,机柜网孔面板上排列青色指示灯,暖橙与青色光带沿机柜走向流动

图片来源:北京拓实科技原创(AI 生成封面)

发生了什么

xAI 于 2026 年 9 月 21 日发布 Grok 4.7,并将其定位为面向编程、智能体任务与知识工作的新一代旗舰模型。与过去两年旗舰迭代常见的「能力上探、单价上调」路径不同,此次发布的定价与前代完全持平:每百万 token 输入 2 美元、输出 6 美元,缓存输入 0.5 美元;当单次请求的提示词超过 20 万 token 时,输入与输出单价分别升至 4 美元与 12 美元。官方另提供一个输出速度翻倍、价格为两倍的 fast 版本。上下文窗口为 50 万 token,与前代一致。

分发节奏是这次发布的一个明确动作:模型没有采用分阶段灰度,而是在 Cursor、Grok Build、xAI API、第三方编码框架、模型路由平台与云平台上同日上线;GitHub 亦在首发当日把 Grok 4.7 加入 Copilot 的 Pro、Pro+、Max、Business 与 Enterprise 订阅档。对已经使用 Grok 4.6 的团队而言,迁移只需在既有渠道内切换模型标识。

能力变化与关键指标

  • 底座与训练:换用比 Grok 4.6 更大的基础模型,强化学习训练时长延长,训练任务的难度分布整体上移,权重向需要数小时才能完成的长程问题倾斜,官方称结果是模型更擅长自检与管理长上下文。
  • Grok Bot 原生适配:模型被专门训练以理解 xAI 自研的 Grok Bot 智能体运行环境。Grok Bot 于 8 月 11 日发布,定位为一组持续运行、各自拥有独立计算机的智能体。
  • 编码基准:CursorBench 4.0 由 40.4% 升至 46.3%;DeepSWE v1.1 由 65.2% 升至 71.0%;Terminal-Bench 4.0 由 20.3% 升至 38.0%,接近翻倍。
  • 知识与专业任务:EEBench 电气工程基准 64.0%,Harvey 法律智能体基准 19.6%,HealthBench Professional 56.7%,GDPval Elo 1,695(前代 1,605)。
  • 安全侧:官方称采用全新重写的安全护栏栈,LatchBio 生物安全基准 62.4%,HackerBench v0.3 中仅 3.3% 的风险提示词被放行;同时以邀请制开放红队能力给部分网络安全合作方。

为什么重要

这次发布最有价值的信号在定价而非排名。官方对比表中列出的竞品价格分别为每百万 token 4 美元 / 20 美元与 10 美元 / 50 美元,Grok 4.7 把「万亿参数级前沿能力」的心理价位继续钉在 2 美元 / 6 美元。对企业采购而言,这意味着同一预算下可调用的推理量上升,长程编程智能体的单任务成本随之下移;对厂商而言,则意味着中端型号的降价压力进一步加大。

需要客观看待的是,在官方同一张表内,Grok 4.7 的领先集中在 EEBench 与 Harvey 法律基准,而在 CursorBench 4.0(46.3% 对 51.8%)、Terminal-Bench 4.0(38.0% 对 57.9%)、AA Briefcase v1.1(1,657 对 1,678)与 HealthBench Professional(56.7% 对 62.1%)上仍落后于竞品。官方在 GDPval 段落中的表述也相对克制,仅称其「表现与其他前沿模型相当」。

仍待确认

表格中的全部数字均由 xAI 自行测量并发布,没有独立第三方复现;而且各模型并非在同一推理强度档位下运行,官方在表下注明了这一点,因此该对比更适合作为方向性参考而非受控实验结论。此外,媒体广泛引用的「参数规模由上代 1.5 万亿升至约 2.1 万亿」出自媒体口径,官方发布材料未予确认。企业在正式迁移前,建议以自有任务集做 A/B 验证,而非直接引用榜单。

编辑说明

本文由北京拓实科技根据公开信息整理,核心事实与数据请以原始来源为准。