千寻智能高阳:人形机器人最快明年可听懂口头指令,家庭实用仍需时间
据 IT之家 9 月 18 日援引路透社报道,清华大学机器人学助理教授、千寻智能联合创始人兼首席科学家高阳表示,人形机器人最快从明年开始,有望理解口头指令并完成多数通用任务。不过,这并不意味着机器人很快就能进入普通家庭、稳定承担家务和照护等实用工作。来源显示,中国人形机器人近年的硬件能力提升明显,奔跑、跳舞乃至按指令完成后空翻等动作已不再是主要瓶颈,行业竞争重心正在从“能不能动”转向“能不能理解并完成有价值的任务”。
从硬件展示转向“具身智能”竞争
过去一段时间,人形机器人行业的公众关注点多集中在运动能力:能否保持平衡、能否快速移动、能否完成复杂姿态。但随着硬件平台逐步成熟,企业真正要解决的问题变成了软件和智能系统。高阳在报道中指出,机器人技术栈中最薄弱的一环是“大脑”,也就是让机器人理解环境、理解语言、规划动作并在现实世界中执行的能力。
这一方向通常被称为具身智能。它与纯文本或图像生成模型不同,机器人需要在物理空间里行动,面对光照、物体形状、位置变化、碰撞风险和任务失败等复杂情况。即使用户只是说一句“把桌上的杯子拿过来”,机器人也需要完成环境识别、目标定位、路径规划、抓取控制和异常处理等一整套流程。
高阳预计,到 2027 年年中,相关能力有望达到类似“GPT-3.0”级别的里程碑。按照他的描述,届时用户可以直接用自然语言与机器人交流,机器人会执行一系列合理的物理动作,尝试完成任务。这一判断也反映出行业正在等待属于机器人的“ChatGPT 时刻”:一次软件层面的突破,把前沿技术真正推向更广泛的客户和场景。
数据训练成为机器人“大脑”的关键燃料
与大模型依赖海量文本、图像和代码数据类似,人形机器人要获得更强的现实世界能力,也需要大量真实交互数据。报道提到,为了训练机器人,千寻智能在全国安排约 1000 名合同人员收集真实世界数据。这类数据对于机器人学习如何移动、抓取、避障和处理任务流程具有重要意义。
来源显示,目前千寻智能的机器人在结构化客厅环境中完成简单任务的成功率达到 90%。这一指标说明,在经过设计和限制的环境中,机器人已经具备一定的任务执行能力。但“结构化环境”与普通家庭仍有距离。真实家庭中物品摆放高度不确定,空间更杂乱,用户指令也更模糊,这些都会显著增加任务难度。
- 短期看,工业场景更可能率先落地,因为环境规则清晰、任务重复度高、商业回报更容易计算。
- 中期看,商业服务场景可能出现更多试点,例如简单接待、搬运、整理等相对标准化任务。
- 长期看,家庭场景仍是难度最高的方向,需要机器人具备更强泛化能力和安全可靠性。
影响与解读:机器人商业化不会只靠“会聊天”
从 AI 产业角度看,人形机器人正在经历与大模型相似但更复杂的演进路径。ChatGPT 的成功证明,自然语言交互可以显著降低技术使用门槛;但机器人要实现商业化,不能只是“听懂人话”,还必须在真实环境里稳定、低风险、可重复地完成动作。这也是为什么高阳强调,进入家庭要比进入工业和商业服务场景困难得多。
报道中还提到,千寻智能成立时,机器人只能完成倒水、叠一件衣服这类单独任务;如今已经可以在更大范围空间内移动,并连续执行更复杂的工作流程。这表明行业能力正在从单点演示走向流程化作业。不过,旋开瓶盖等精细操作,以及处理此前没有遇到过的新任务,仍是机器人需要攻克的难题。
对中文科技产业观察者而言,这一进展意味着人形机器人接下来的竞争重点将集中在三方面:一是多模态模型与机器人控制系统的结合;二是真实世界数据采集和训练效率;三是能否找到可规模化付费的应用场景。相比炫技式展示,真正决定产业价值的将是机器人能否在工厂、商场、仓储、办公和家庭中承担持续性的实际工作。换言之,人形机器人或许很快能更自然地理解人类指令,但距离成为日常生活中的可靠助手,仍需要软件、硬件、数据与场景共同成熟。