Grok 4.5 发布:SpaceXAI 首个编程智能体模型,与 Cursor 联合训练并主打高性价比
据 IT之家 7 月 9 日消息,SpaceXAI 今日正式发布 Grok 4.5。这是该公司首个专门面向编程与智能体任务训练的模型,由 SpaceXAI 与代码编辑器工具 Cursor 联合完成训练。来源显示,Grok 4.5 重点面向真实工程场景,强调在大型代码库、跨仓库协作、长时间多步骤任务中的执行能力,同时试图在速度和成本上压低开发者使用门槛。马斯克将其称为“Opus 级模型”。目前,Grok 4.5 已在 SpaceXAI 控制台、Grok Build 以及 Cursor 中可用,用户也可通过 x.ai/cli 免费开始使用。
面向软件工程智能体:从写代码走向“完成任务”
与通用聊天模型不同,Grok 4.5 的定位更接近编程智能体基础模型:它不仅要生成代码,还要能理解项目结构、调用工具、跨多个仓库处理任务,并在较长时间跨度内保持目标一致性。来源介绍称,该模型擅长处理大型代码库,以及涉及数百种技能和多种工具的长时间任务,这意味着其目标场景并不止于“补全函数”或“解释报错”,而是覆盖更接近真实工程团队的工作流。
训练层面,Grok 4.5 据称在数万个 NVIDIA GB300 GPU 上完成训练。团队在数据过滤与筛选上投入大量工作,通过去重、质量评分和领域聚焦筛选等方式,提高训练数据的覆盖度与信号质量。在强化学习阶段,训练覆盖数十万个任务,重点围绕多步软件工程及其他技术工作,并采用自动化与基于模型的评分机制。
- 训练方向:聚焦编程、工具调用、多步软件工程与智能体任务。
- 合作方:与 Cursor 联合训练,强化在真实开发环境中的适配。
- 适用场景:大型代码库、多仓库任务、端到端功能应用构建,以及 Rust、C/C++ 等复杂工程任务。
- 办公能力:除代码外,也覆盖 Excel、PowerPoint、Word 等 Office 工作流。
速度与成本成为核心卖点
在模型竞争进入工程落地阶段后,开发者关注的不只是能力上限,还包括响应速度、单次任务消耗和长期调用成本。来源显示,Grok 4.5 单个任务消耗的 Token 仅为同级领先模型的一半,每秒输出 Token 数达到 80 TPS,且单次任务步骤数少一半。定价方面,其每百万输入 Token 为 2 美元,每百万输出 Token 为 6 美元,来源称整体成本不到同类可比模型的一半。
如果这些指标能在实际开发环境中稳定体现,Grok 4.5 的优势可能体现在两类用户上:一类是高频使用 AI 编程工具的个人开发者,另一类是希望将 AI 智能体嵌入内部研发流程的企业团队。对于后者而言,Token 成本和任务步骤数会直接影响自动化代码审查、批量迁移、测试生成、文档补齐等场景的总体开销。
不只写代码:Grok Build 展示办公自动化潜力
来源还提到,Grok 4.5 在 Grok Build 中展示了面向 Office 工作场景的能力。例如,它可以构建包含网络研究、多工作表公式的复杂 Excel 模型,并留下便签供后续参考;在 PowerPoint 中可使用原生形状绘制复杂图表并设计直观幻灯片;在 Word 中则可撰写清晰文章。这些能力说明,SpaceXAI 并不只想让 Grok 4.5 成为程序员工具,而是希望其进入更广泛的知识工作自动化场景。
从产品路线看,Grok 4.5 同时进入 SpaceXAI 控制台、Grok Build 和 Cursor,意味着其分发渠道覆盖 API、可视化构建工具与开发者 IDE 工作流。Grok Build 和 Cursor 将提供一段时间免费用量,所有使用限制也已重置。不过,来源显示,该模型目前尚未在欧盟地区的 SpaceXAI 产品或 API 控制台开放,预计将于 7 月中旬上线。
影响解读:AI 编程工具进入“模型与 IDE 联训”阶段
Grok 4.5 的一个重要信号,是基础模型厂商与开发工具之间的关系正在加深。Cursor 本身是 AI 编程工具的重要代表,与模型厂商联合训练,可以让模型更贴近编辑器、代码库、终端、测试与版本管理等真实上下文,而不是停留在静态问答。对开发者来说,这类模型的价值将越来越取决于能否稳定完成端到端任务,而非单次回答是否漂亮。
当然,真实效果仍需要更多独立评测和用户实践验证,尤其是复杂项目中的可靠性、权限控制、代码安全以及长任务失败后的恢复能力。总体来看,Grok 4.5 的发布表明,AI 编程模型的竞争焦点正在从“更会写代码”转向“更便宜、更快、更像工程协作者”。