OpenAI 发布 GPT-6.1 Sol:接近 Astra 的性能,标准价格降至五分之一
据 IT之家 9 月 30 日消息,OpenAI 在当天举行的开发者活动中正式发布 GPT-6.1 Sol 模型。官方将其定位为在当前同等性能区间内“性价比最高”的模型:在多项智能体编程、电脑操作与专业工作流任务上,GPT-6.1 Sol 的表现接近旗舰模型 GPT-6 Astra,但标准输入与输出 Token 价格仅为 Astra 的五分之一。对于需要大规模调用模型的开发者、企业自动化团队和 AI 工具厂商而言,这意味着高阶模型能力正在进一步向成本敏感型场景下沉。
定位:不是旗舰替代品,而是高性能低成本选择
来源显示,GPT-6 Astra 是 OpenAI 于 2026 年 9 月推出的旗舰级大语言模型,官方强调其在智能程度、对齐能力、长程多步骤任务和专业工作流上的表现。而此次推出的 GPT-6.1 Sol,更像是围绕“可用成本”重新优化后的高性能模型:它并不主打全面超越 Astra,而是在接近旗舰能力的同时显著降低调用费用。
从定价看,GPT-6.1 Sol 按上下文长度和处理模式区分价格。短上下文场景,即输入 Token 不超过 272,000 时,Standard 标准模式输入价格为每百万 Token 2 美元,输出为每百万 Token 10 美元;Batch 和 Flex 模式价格更低,Fast 模式则因优先处理而更贵。长上下文场景下,Standard 输入价格为每百万 Token 4 美元,输出为每百万 Token 15 美元。
OpenAI 还强调,GPT-6.1 Sol 的缓存输入成本为每百万 Token 0.1 美元,相比 GPT-6 Sol 降低 50%。这对经常复用上下文、构建长对话记忆、代码仓库分析、知识库问答和企业流程代理的应用尤其关键,因为缓存成本往往会直接影响长期运行费用。
四种处理模式对应不同 AI 应用
此次 GPT-6.1 Sol 提供 Standard、Batch、Flex、Fast 四类处理模式,实际上是在把模型服务拆成不同的成本与延迟档位,方便开发者按场景选择。
- Standard 标准模式:正常处理速度,适合日常开发、通用 AI 应用和常规生产环境。
- Batch 批量模式:速度较慢,面向异步大规模任务,例如离线数据处理、批量文档分析。
- Flex 弹性模式:根据系统负载动态调整,更适合在成本与速度之间寻求平衡的业务。
- Fast 快速模式:优先处理、延迟更低,适合实时对话、在线助手和低延迟交互。
这种分层定价对 AI 产品商业化很重要。过去不少企业在尝试智能体、代码助手或自动化办公时,常常面临“效果好的模型太贵,便宜的模型不够稳”的取舍。GPT-6.1 Sol 的思路,是让开发者在同一模型能力基础上,根据实时性要求选择不同费用档位。
性能表现:智能体、代码与电脑操作是重点
根据官方披露的评测信息,GPT-6.1 Sol 在软件工程、专业文档、自动化工作流、电脑操作和科学终端任务等方向均有提升。在 DeepSWE v1.1 软件工程评测中,较高推理强度下其表现与 GPT-6 Astra 相当;在较低推理强度和成本条件下,相比 GPT-6 Sol 高出 6.4 个百分点。
在专业文档与复杂任务 GDP.pdf 中,GPT-6.1 Sol 以不到 Opus 5.5 一半的任务成本取得更好结果。AutomationBench 中等推理强度评测显示,它比 Opus 5.5 高 2.2 个百分点,成本约为后者三分之一。电脑操作 OSWorld 2.0 离线评测中,在最大推理强度下,GPT-6.1 Sol 比 GPT-6 Sol 高 7 个百分点,成本不足后者一半;与 Astra 相比仅低 2.1 个百分点,但单任务成本约为 Astra 的七分之一。
在 Terminal-Bench Science 0.1 科学终端任务中,GPT-6.1 Sol 得分达到 GPT-6 Sol 的两倍以上,单任务平均成本为 5.47 美元,低于 Opus 5.5 的 23.21 美元和 Astra 的 23.80 美元。对需要模型执行真实操作链路的场景来说,这类指标比单纯聊天能力更具参考价值。
影响解读:高阶 AI 工具的成本门槛继续下降
GPT-6.1 Sol 的核心意义不只是“又一个新模型”,而是 OpenAI 正在把旗舰级能力向更低成本区间扩散。尤其是智能体编程、电脑操作和专业工作流这些方向,通常需要大量 Token、反复推理和多步骤执行,成本一直是规模化落地的重要阻碍。
可靠性方面,来源显示 GPT-6.1 Sol 在低推理强度下的事实错误比例从 GPT-6 Sol 的 11.4% 降至 7.7%,下降约 32%;在所有推理设置下,与 Astra 的错误率差距控制在 1.9% 以内。同时,它在困难评测中更少忽略失效搜索工具,更能遵守明确限制,并减少未经授权的操作;安全测试中未观察到试图绕过自动化安全审查器的行为。
开放节奏方面,GPT-6.1 Sol 自 9 月 29 日起面向 ChatGPT Work 与 Codex 的 Plus、Pro、Business、Enterprise、Edu 用户开放。对于中文开发者和企业用户而言,值得关注的不是单项跑分,而是单位任务成本、长上下文费用、缓存策略和延迟模式能否组合出更可持续的 AI 产品形态。随着这类模型继续降价,代码代理、自动化办公助手、文档处理系统和行业工作流智能体都有望更快进入实际部署阶段。