人工智能

OpenAI 推出 GPT-6 Astra Ultrafast:Codex 最高每秒 300 Token,API 生成速度提升至 6 倍

2026年9月30日 · admin
OpenMagic API

据 IT之家 9 月 30 日消息,在 2026 年 OpenAI 开发者日活动中,OpenAI 发布了名为 Ultrafast 的全新服务层级,并将其应用到 GPT-6 Astra。来源显示,GPT-6 Astra Ultrafast 在 Codex 中最高可实现每秒 300 个词元(Token)的生成速度;在 API 调用场景下,生成速度最高可提升至 6 倍,在 Codex 中则可达到最高 8 倍 Token 生成速度。目前该服务已开放 API 调用,Pro 500 订阅用户和企业用户可在 ChatGPT Work 与 Codex 中体验。

GPT-6 Astra Ultrafast 的核心变化:更快的生成,而不是单纯换小模型

从产品定位看,Ultrafast 并不是一个普通的新模型名称,而更像是 OpenAI 面向高实时性任务推出的性能服务层。过去,开发者如果希望获得更快响应,往往需要在模型能力和速度之间取舍,例如改用更小模型、专用模型,或压缩上下文与输出规模。此次 OpenAI 强调的是在较强模型能力基础上提升“每秒有用工作量”,这对需要连续交互的 AI 应用尤其关键。

来源摘要提到,Ultrafast 的价值在于让“更强模型”与“实时响应”尽可能兼得,并适用于事件响应、实时客服、交易或市场快讯生成、交互式编码等场景。对于中文开发者和企业用户而言,这意味着 AI 不只是“答得更好”,还要在业务系统中“等得起、跟得上”。

  • Codex 场景:GPT-6 Astra Ultrafast 最高可达到每秒 300 Token,适合代码生成、重构建议、交互式调试等高频输出任务。
  • API 场景:官方信息显示 API 调用时生成速度最高可达 6 倍,便于接入在线产品、客服系统和自动化工作流。
  • 用户范围:目前已开放 API 调用,Pro 500 订阅与企业用户可在 ChatGPT Work 和 Codex 中体验。
  • 后续计划:OpenAI 表示后续还将跟进推出 GPT-6.1 Sol Ultrafast。

API 价格:长上下文与缓存机制成为成本重点

在价格方面,IT之家查询官方信息显示,GPT-6 Astra 的 API 计费区分短上下文和长上下文:短上下文指输入小于 272K Token,长上下文指输入大于 272K Token。短上下文输入价格为每 100 万 Token 60 美元,长上下文输入价格为每 100 万 Token 120 美元;输出价格分别为每 100 万 Token 300 美元和 450 美元。

缓存相关价格同样值得关注。缓存输入在短上下文下为每 100 万 Token 6 美元,长上下文下为 12 美元;缓存写入价格则分别为 75 美元和 150 美元。简单理解,缓存写入是首次把一段输入内容保存进提示词缓存,后续重复使用这部分内容时,便可按更低的缓存输入价格计费。这对需要反复调用同一系统提示词、知识背景或长文档上下文的企业应用很重要。

影响解读:实时 AI 应用的门槛继续下降,但成本管理更重要

GPT-6 Astra Ultrafast 的发布,反映出大模型竞争正在从“参数能力”和“推理质量”进一步转向响应速度、吞吐能力与工程可用性。对开发者来说,更快的 Token 生成速度能够减少用户等待,提高交互密度,使 AI 编程助手、智能客服、内容生产系统和市场监测工具更接近实时协作体验。

不过,速度提升并不意味着使用成本可以忽略。尤其在长上下文、高输出量和实时多轮交互场景中,输出 Token 价格、缓存写入成本、上下文长度选择都会直接影响预算。企业在接入这类高速模型时,可能需要更精细地设计提示词缓存、上下文裁剪、分层模型调用和结果复用机制。

整体来看,OpenAI 通过 Ultrafast 把高性能模型推向更强调即时性的生产环境。对于 AI 工具、自动化系统和软件效率产品而言,这类服务层的出现,可能会推动更多“边想边做”的应用形态落地:代码助手不再只是生成片段,客服系统不再只是排队回复,市场分析工具也能更快完成信息整理与摘要生成。