人工智能

SpaceXAI 推出 Grok 4.7:面向编程与知识工作的更强模型,输入每百万词元 2 美元起

2026年9月22日 · admin
OpenMagic API

据 IT之家 9 月 22 日消息,SpaceXAI 今日宣布推出新一代模型 Grok 4.7,定位为该公司目前最强的编码与知识处理模型。官方称,新模型采用更大规模基础模型,并经过更长时间的强化学习训练,重点面向编程、长时间复杂任务和专业知识工作场景。目前,Grok 4.7 已通过 Cursor、Grok Build 和 Grok API 提供,并支持第三方编程工具、模型路由服务及云平台接入。

更大的基座模型与更长强化学习:主攻复杂任务

从官方披露的信息看,Grok 4.7 相比 Grok 4.6 的核心变化并不只是参数或接口升级,而是训练目标更明确地转向“长任务”。SpaceXAI 表示,新模型使用了比上一代更大的基座模型,并接受更长时间的强化学习训练,训练数据也更偏向需要数小时才能完成的复杂任务。

这类能力对 AI 编程工具尤为关键。当前代码生成模型已经可以完成补全、函数生成和简单调试,但在跨文件修改、长期迭代、理解项目上下文以及自查错误方面仍容易出现断裂。官方称,Grok 4.7 在困难任务上能够持续更长时间,并强化了对自身输出结果的检查能力,这意味着它更适合承担自动化开发流程中的“长链路”工作。

在 CursorBench 4.0 测试中,Grok 4.7 面向长时间运行的编程任务,在价格与性能方面处于同类模型前列。SpaceXAI 同时表示,该模型的运行速度和定价与 Grok 4.6 相同,并称其速度是同类模型的两倍、价格只有一半。不过,具体对比对象和完整测试条件仍需以官方后续材料或第三方评测为准。

不只写代码:面向知识工作、文档与演示生成

除编程外,Grok 4.7 也强化了通用知识工作能力。SpaceXAI 表示,模型针对 Grok Bot harness 进行了原生训练,使其在对话和一般知识工作任务中的表现得到提升;同时,在文档和演示文稿生成方面也有所改进。

在 GDPval 和 AA Briefcase 两项基准测试中,Grok 4.7 均较 Grok 4.6 有提升。这些测试要求 AI 完成律师、护士、金融分析师等专业人士日常工作中的相关任务。官方称,Grok 4.7 在两项测试中的表现已接近其他前沿模型水平。对企业用户来说,这类能力意味着模型不只是“聊天机器人”,而是可能进一步进入报告撰写、资料整理、合规分析、业务简报等生产流程。

  • 编程场景:面向长时间运行的代码任务、项目级修改和自我检查进行优化。
  • 知识工作:提升对话、文档生成、演示文稿生成及专业任务处理能力。
  • 安全能力:采用新的安全防护体系,加强拒答与越狱抵抗。
  • 接入方式:已开放 Cursor、Grok Build、Grok API 及第三方平台支持。

安全与双重用途:在可用性和风险控制之间取平衡

安全方面,SpaceXAI 称 Grok 4.7 采用了新的安全防护体系,在拒答和抵抗越狱攻击方面达到公司当前测试中的最高水平。对于网络安全和生物领域等具有双重用途的任务,官方强调模型会在合法任务可用性与危险任务拒答之间寻找平衡。

来源显示,Grok 4.7 在 LatchBio 生物安全基准测试中取得 62.4% 的成绩;在 HackerBench v0.3 测试中,仅允许 3.3% 的高风险双重用途提示通过,同时尽量减少对合法安全工作的误拦截。SpaceXAI 还表示,已开始向部分网络安全合作伙伴提供邀请制访问权限,用于红队能力和防御研究。

价格与影响:AI 编程模型竞争继续转向“性能/成本比”

价格方面,Grok 4.7 每百万词元输入起价为 2 美元,每百万词元输出起价为 6 美元。SpaceXAI 还提供高速版本,输出速度翻倍,但价格也相应翻倍。对于需要大规模调用模型的开发团队和 SaaS 厂商而言,输入输出成本、响应速度和长上下文稳定性,将直接影响产品能否落地。

从行业角度看,Grok 4.7 的发布延续了前沿模型向垂直生产力场景深入的趋势。相比单纯追求通用问答能力,新一代模型更强调可持续执行复杂任务、能自查、能接入工具链、能控制调用成本。这也意味着 AI 编程助手、自动化知识办公和企业内部智能体的竞争,将越来越围绕真实工作流展开,而不只是基准分数本身。