人工智能

华为称小艺 IPhO 理论考试得分 28.6/30,超过第 56 届国际物理奥赛金牌线

2026年7月31日 · admin
openmagic ad

据 IT之家 7 月 30 日消息,第 56 届国际物理奥林匹克竞赛(IPhO 2026)日前落幕。华为官方今日宣布,其 AI 智慧助手“小艺”在本届 IPhO 理论考试中取得 28.6 分(满分 30 分)的成绩,分数超过理论考试金牌线。华为方面将这一结果视为小艺在复杂科学问题求解能力上的一次验证,并特别提到其 Agentic 系统在多模态复杂任务处理中的潜力。

从公开信息看,IPhO 理论考试并非简单套用公式的标准化题型,而是以模型复杂、推导链条长、综合性强著称。对于 AI 助手而言,这类任务不仅考查知识覆盖面,也考验物理建模、数学推导、长上下文保持、步骤校验与最终表达能力。

IPhO 理论题为何适合检验 AI 科学推理能力

来源显示,本届 IPhO 三道理论大题覆盖多个物理方向,包括流体静力学中的力矩平衡与相对论散射、光学多次反射及渐晕线包络线推导,并涉及泰勒展开;另一题则围绕磁制冷循环中的麦克斯韦关系证明与降温时间积分计算展开。这些内容对顶尖物理系学生也具有较高难度。

与常见知识问答相比,奥赛理论题更接近“复杂任务求解”:AI 需要先理解题意与物理情境,再建立变量关系、选择合适近似或数学工具,并在多步推导中避免逻辑断裂。若最终结果能够接近高分区间,说明模型或系统在 科学推理链路 上具备一定稳定性,而不只是依靠记忆答案。

  • 跨学科综合:题目同时涉及力学、光学、热力学、相对论和数学推导。
  • 推导过程复杂:需要连续构建模型、展开公式、积分计算并保持符号一致。
  • 难以模板化:来源称无套路化公式可直接套用,更依赖真实推理。
  • 对 Agent 能力要求更高:需要规划解题步骤、检查中间结果,并整合多模态信息。

小艺从“助手”走向“系统级 Agent”

小艺是华为自主研发的 AI 智慧助手,已提供 AI 知识问答、AI 写作、AI 文档阅读、文档助手、编码助手、鸿蒙代码生成等功能。与单一聊天机器人不同,小艺的产品定位正在向跨设备、跨场景的系统级助手延伸。目前其已适配网页、手机、平板、手表、智慧屏、车机、家庭中控、PC、耳机、音箱等终端。

今年 6 月,华为小艺 Claw 接入开源盘古 openPangu 2.0 Pro 模型。来源介绍称,该模型更亲和昇腾算力,单卡吞吐率可达其他业界主流开源模型的 2 倍,并可重点提升鸿蒙系统级任务执行能力。对于终端 AI 来说,模型性能只是基础,能否理解用户意图、调度系统能力、完成真实任务,才是下一阶段竞争重点。

影响解读:AI 助手竞争进入“高难任务验证”阶段

过去,AI 助手的能力常通过对话流畅度、知识问答准确率或文本生成质量体现。但随着大模型进入操作系统、办公软件和智能硬件,行业正在寻找更具含金量的评测场景。IPhO 这类高难科学考试之所以受到关注,是因为它能暴露模型在长链推理、数学严谨性和复杂问题拆解上的短板。

不过也需要注意,单次考试成绩并不能完全等同于通用科研能力。AI 是否能够在开放问题、实验设计、数据噪声、真实工程约束中稳定发挥,还需要更多公开、可复现、多维度评测来验证。对于中文用户和鸿蒙生态而言,更值得关注的是:这类科学推理能力能否进一步转化为学习辅导、研发辅助、代码生成、设备自动化控制等日常场景中的可靠体验。

总体来看,华为此次公布小艺在 IPhO 理论考试中的高分表现,释放出一个信号:AI 助手的竞争正在从“会聊天、会写作”转向 会推理、会执行、会跨设备完成任务。如果模型、算力与操作系统生态能够持续协同,小艺未来在鸿蒙设备上的 Agentic 能力或将成为华为 AI 终端战略的重要抓手。