OpenAI 推进 ChatGPT 电脑操作能力:让智能体能像人一样使用浏览器和软件
据 IT之家援引《商业内幕》8 月 20 日报道,OpenAI 内部对“让 AI 智能体熟练操作电脑”这一长期目标的实现进度持乐观态度。来源显示,OpenAI 正逐步向客户开放相关电脑操作功能,重点是让 ChatGPT 等智能体能够使用浏览器、理解网页与软件界面,并完成数据录入、合规处理、日程安排等任务。这一方向并非临时新增能力,而是 OpenAI 自 2015 年成立以来持续推进的目标之一,核心难点长期集中在训练数据、操作可靠性和安全授权机制上。
从看屏幕到读网页底层信息
传统的电脑操作智能体通常依赖“截图—识别—点击—再截图”的循环:模型需要读取屏幕像素,判断按钮、输入框和页面状态,再输出鼠标或键盘操作指令。OpenAI 电脑操作团队经理阿里·韦恩斯坦表示,过去 ChatGPT 也需要反复截屏分析,但现在系统在打开网站后,已能更快读取网页底层信息,包括内存结构、无障碍信息和链接关系等。
这意味着,智能体不再只是“看见”屏幕,而是在一定程度上理解网页结构与交互逻辑。不过,屏幕截图仍然是流程的一部分。当用户启用电脑操作功能时,需要允许 ChatGPT 录屏,以便系统快速识别当前显示内容。这也让电脑操作能力同时具备“视觉理解”和“结构化读取”两条路径。
来源还提到,OpenAI 最新模型从训练初期到后期都加入了面向电脑操作的数据和训练流程。参与开发电脑操作智能体基准测试的哥伦比亚大学 AI 研究员周宇认为,这类训练是在通用 AI 模型既有能力之上继续强化,让模型学会完成更多真实电脑任务。
训练数据是关键:真人示范与强化学习并行
要让 AI 学会操作电脑,仅靠网页文本或代码数据远远不够。报道显示,在最初的大规模基础训练阶段,OpenAI 很可能加入了逐帧屏幕截图,让模型提前接触与电脑操作相关的信息。进入后续训练阶段后,开发人员会向模型展示完成特定任务所需的正确步骤,例如填写税务表格、完成 3D 模型等。
其中一部分训练数据来自真人示范。OpenAI 在公布 2025 年版电脑操作功能时曾提到,公司使用过人类演示任务完成过程的数据集,但未披露最新训练数据细节。周宇指出,这类数据成本很高,不仅获取困难,还需要整理成适合训练的格式。
此外,OpenAI 很可能还利用强化学习提升模型表现:让模型在虚拟任务中反复尝试,并对成功完成任务的行为给予奖励。通过这种方式,模型可以逐渐学会更多“被奖励过的操作路径”。
- 基础训练阶段:让模型接触屏幕截图等操作环境信息;
- 后训练阶段:通过示范任务教会模型具体操作步骤;
- 强化学习阶段:让模型在试错中提高完成任务的成功率;
- 运行阶段:结合截图、网页结构和无障碍信息执行操作。
影响解读:浏览器可能成为 AI 智能体的通用入口
从产业角度看,电脑操作能力的意义不只是“自动点击网页”。它真正指向的是:让 AI 智能体进入大量没有专门 API、也没有为 AI 优化过的在线系统。OpenAI 相关负责人认为,这项技术能让 ChatGPT 进入互联网中大量彼此独立的服务和“长尾”网站,包括预约网站、企业内部库存系统、社媒平台等。
这些工具最初大多是为人类手动点击和输入设计的。如果 AI 能稳定理解界面、填写表单、检查结果并自我纠错,就可能成为企业自动化的新层级。报道称,已有用户将电脑操作能力用于数据录入、合规任务和日程安排。韦恩斯坦还提到,当这些能力结合后,Codex 可以自行测试生成代码、发现问题并继续修改,形成“完整闭环”。
这对中文用户和企业同样有参考意义。过去,自动化往往依赖 RPA、脚本或平台接口,部署成本和适配成本都不低;而如果智能体能直接操作现有网页和软件,许多低频、碎片化、长尾流程有机会被 AI 接管。不过,这一前景仍取决于速度、稳定性和权限管理。
短板仍明显:速度、安全与泛化能力未完全解决
周宇认为,在训练数据非常充足的有限领域,电脑操作智能体确实可以表现很好;但要适应任何网页、任何应用程序和任何操作系统,仍然非常困难。报道称,目前相关功能还不能迅速批量处理邮件回复,在浏览社交媒体信息流时也显得较为迟缓。
安全风险同样是关键问题。OpenAI CEO 萨姆·奥尔特曼在 2025 年谈到早期电脑操作功能时曾提醒,这项能力实用价值很大,但潜在风险也不小,并建议只向智能体提供完成任务所必需的最低权限。OpenAI 浏览器能力负责人詹姆斯·孙表示,公司正在研究“确认策略”,即 AI 在执行下一步前,何时需要向用户请求授权。目前原则是:只要智能体准备向外传输数据或删除内容,就必须先获得用户同意。
总体来看,OpenAI 正把 ChatGPT 从问答和生成工具推向“可执行任务的电脑代理”。如果未来其操作速度和可靠性接近当前 AI 编程工具的效率,用户与电脑交互的默认方式可能会发生变化:从亲自打开网页、输入信息,转向向智能体描述目标并监督关键授权。但在此之前,行业仍需解决数据成本、跨环境泛化、隐私保护和误操作责任等难题。