Claude 挑战九圈散射振幅:Anthropic 称其刷新理论物理计算纪录
据来源显示,Anthropic 近日宣布,旗下 Claude 在一项理论物理前沿计算中取得新进展:在几乎无人类干预的情况下,连续运行数天后,完成了平面 N=4 超杨-米尔斯理论中六粒子振幅的九圈结果计算。此前,人类团队在这一方向上的公开纪录停留在八圈。该问题与杨振宁、米尔斯在 1954 年提出的杨-米尔斯理论相关,是现代粒子物理的重要理论基础之一;而高阶散射振幅计算长期被认为是理论物理中计算难度极高的任务。
这次事件之所以受到关注,不只是因为“九圈”本身的难度,还因为据报道 Claude 的运行方式相当接近“长时间自主科研代理”:研究人员给出任务后,让系统在数天内持续推演、定期汇报进度,并最终提交结果。来源称,相关花费为几千美元量级,而结果中仅一部分展开就包含约 300 亿项。
从公开挑战到 AI 接题:难点在“圈数”指数增长
事件起点来自理论粒子物理背景的科普作者 Matt von Hippel。他曾参与过五圈、六圈和七圈相关论文工作,并在博客中向 AI 公司提出挑战:如果要证明 AI 真能震撼科研人员,就应在普通学者可承受的预算内,解决散射振幅领域的未解难题。其中一道题正是计算 N=4 超杨-米尔斯模型的九圈六粒子振幅。
散射振幅用于描述粒子相互作用,是高能物理中连接理论与实验预测的重要工具。所谓“圈”,可以理解为对结果不断加入更高阶修正;圈数越高,理论预测越精细,但计算复杂度也会急剧上升。来源提到,在多数实际问题中,研究者往往停留在二圈或三圈,粒子物理中很高精度的预测也只到五圈;在更特殊、更适合作为理论测试场的模型中,八圈已是人类团队多年推进后的极限纪录。
Anthropic 团队据称使用了面向科学研究的 Claude Science 系统,以及公开可用的最强模型版本。研究人员输入的核心任务相当直接:计算平面 N=4 SYM 模型九圈下的六粒子振幅。随后,Claude 主要依靠此前 Dixon 等研究者发展出的“自举”方法继续推进。这类方法可被类比为在严格约束条件下求解复杂“数独”:不是蛮力列举所有可能,而是在对称性、解析结构等条件约束下缩小解空间。
- 任务对象:平面 N=4 超杨-米尔斯理论中的六粒子振幅。
- 目标难度:从此前人类纪录八圈推进到九圈。
- 运行方式:据报道为数天连续运行,人工干预很少,并定期汇报进度。
- 验证角色:相关结果由领域物理学家参与核验,来源中特别提到 Lance Dixon 的评价。
影响解读:AI 科研代理开始触及“专家级边界”
对 AI 行业而言,这一案例的关键不在于 Claude 是否“理解了物理”,而在于大模型正在从写代码、读论文、生成证明草稿,进一步进入高度专业化的科研工作流。散射振幅计算包含文献知识、符号推演、算法执行、错误检查和长时间任务管理,正好考验模型能否在复杂约束下保持方向稳定。
这也解释了为什么该事件会被拿来与 AlphaGo、AlphaFold 相提并论。过去很多领域对 AI 的怀疑并非没有道理:棋类规则明确,蛋白质结构又拥有大量数据积累;而理论物理问题往往更抽象、更依赖专家直觉。此次如果结果经更广泛审查后站得住脚,至少说明在某些高度形式化的前沿问题中,AI 已经可以充当“会自己推进的研究助手”,甚至在特定窄任务上越过人类已有纪录。
不过,仍需保持冷静。来源中的任务并不是让 AI 发明全新的物理理论,而是在既有理论框架、既有方法和明确目标下完成一次极难计算。它更像是将大模型的文献吸收、符号处理、代码执行和持续规划能力组合起来,完成专家也认可的高阶推演。因此,真正值得关注的是:未来科研机构是否会把这类系统纳入常规研究流程,用于寻找候选解、验证复杂公式、扩展已有计算边界。
对中文科技读者的观察:低垂果实可能在专业软件与科学自动化
从产业角度看,这类案例提示了一个方向:AI 的下一个高价值市场,未必只在通用聊天助手,而可能在科学计算、工程仿真、自动化研究平台等专业场景。只要任务有清晰规则、可验证结果和可分解流程,大模型代理就有机会承担过去需要博士级研究者长时间手工推进的部分工作。
对于高校、实验室和科技企业来说,这意味着 AI 工具的评估方式也要变化。单轮问答能力不再足够,长上下文、持续运行、工具调用、进度汇报、结果可复现与专家验证,都会成为科研 AI 系统的核心指标。Claude 这次挑战九圈散射振幅,或许不是“AI 取代理论物理学家”的终点叙事,而是一个更现实的开端:AI 正在进入人类知识生产中最难、也最需要自动化辅助的环节。