GPT-6 Astra 自主通关《传送门》:24 小时实验展示多模态智能体新进展
据 IT之家 9 月 7 日消息,一名 AI 与大语言模型爱好者 CozyBlaze 近日完成了一项引人关注的实验:让 OpenAI 新旗舰模型 GPT-6 Astra 自主游玩并通关 Valve 旗下 3D 解谜游戏《传送门》。来源显示,整个过程持续约 24 小时,共发生 3336 次工具调用,按 API 价格估算成本为 571.18 美元,约合人民币 3838 元。不过实验发起者随后澄清,这部分开销实际由其每月 200 美元的 Codex Pro 订阅覆盖。
这次实验之所以受到关注,并不只是因为 AI 完成了一款经典游戏,而在于它展示了通用型多模态智能体在复杂 3D 环境中的感知、规划与操作能力。相比过去 AI 在简单规则游戏中仍可能表现不稳定,如今模型已经能够在空间解谜、视角移动、路径规划和工具交互等方面形成较完整的闭环。
如何让大模型“玩”一款 3D 游戏
根据 CozyBlaze 的说明,GPT-6 Astra 并不是像人类一样直接拿起键鼠实时操作游戏,而是通过 MCP(Model Context Protocol)以及经过修改的 SourcePauseTool 来控制《传送门》。在模型思考时,游戏会被暂停;当模型生成一组输入指令后,工具再解除暂停并执行这些操作。
在这个过程中,系统会向模型提供游戏截图、玩家角色所在位置等环境信息。GPT-6 Astra 需要基于这些输入理解当前场景,判断下一步应当移动、观察、开门、放置传送门或执行其他动作。随后游戏恢复运行,模型按规划执行操作,再进入下一轮观察与推理。
这也解释了为什么公开视频中经过剪辑的精彩版本约为 2 小时,而完整直播记录累计约 24 小时。大量时间并非游戏本身推进,而是模型在暂停状态下进行分析、规划和生成控制指令。
- 实验对象:OpenAI 新模型 GPT-6 Astra;
- 游戏场景:Valve 3D 解谜游戏《传送门》;
- 交互方式:通过 MCP 与修改版 SourcePauseTool 控制游戏;
- 执行规模:约 24 小时、3336 次工具调用;
- 费用估算:按 API 价格为 571.18 美元,实际由订阅服务覆盖。
为什么《传送门》比传统游戏测试更有意义
《传送门》并不是一个单纯依靠反应速度或固定策略即可完成的游戏。它要求玩家理解三维空间、物理关系、机关逻辑和目标路径,并在不断变化的环境中进行试错。这类任务对 AI 来说更接近“具身智能体”问题:模型不仅要看懂画面,还要能把视觉信息转化为可执行计划。
从这个角度看,GPT-6 Astra 的表现为多模态模型提供了一个直观样本。它表明大模型正在从“回答问题的文本系统”,逐渐走向能够观察环境、拆解任务、调用工具并完成目标的智能体系统。这与当前 AI 行业对 Agent、自动化工作流、计算机控制和软件工程代理的关注方向高度一致。
OpenAI 此前表示,GPT-6 Astra 代表“新一代智能”,并称其在计算机操作、网页浏览、软件工程、网络安全、科学研究以及专业工作等领域达到当前先进水平。此次《传送门》实验虽然并非官方标准测试,但确实为外界观察模型的综合能力提供了一个更具画面感的案例。
仍不能把它当成标准基准
CozyBlaze 对这次成果的态度较为谨慎。他承认,目前仍有许多问题需要解决,也不应把这次通关视作衡量 AI 能力的标准化基准。原因很明显:实验环境经过特殊工具封装,游戏在模型思考时会暂停,且过程耗时较长、调用成本不低,这与人类实时操作或通用机器人控制仍有差距。
不过,它仍然具有产业观察价值。OpenAI 早在 2016 年就曾提出长期愿景:打造一个单一 AI 智能体,能够解决不同类型的游戏任务。如今 GPT-6 Astra 自主探索并完成整个 3D 解谜游戏,至少说明这一方向正在从概念演示走向更复杂的实践。
对中文科技读者而言,这类实验的启示不在于“AI 会不会打游戏”,而在于未来 AI 工具可能如何进入真实软件、网页、设计平台、开发环境乃至机器人系统。游戏只是低风险、高可视化的试验场;真正值得关注的是,模型能否以更低成本、更高可靠性,在开放环境中完成连续任务。此次 GPT-6 Astra 的《传送门》通关,正是这一趋势的最新信号。