多模态 AI 开始会“查装配错误”:GPT-6 Astra 在家具组装测试中准确率达 80%
据 IT之家 9 月 26 日消息,Epoch AI 于当地时间 9 月 23 日公布了一组名为 Furniture Assembly Benchmark(FAB)的家具组装基准测试结果。该测试用宜家家具组装照片和官方说明书,考察多模态 AI 是否能判断家具是否装错、错在第几步以及具体问题。结果显示,OpenAI 最新模型 GPT-6 Astra 在该测试中达到 80% 准确率,位居榜首,显示出多模态模型在现实场景视觉理解与空间推理上的明显进展。
FAB 测试:让 AI 对照说明书“挑刺”
FAB 并不是让模型背诵安装说明,而是模拟用户在现实中可能遇到的场景:家具组装到一半,拍一张照片交给 AI,AI 需要结合官方 PDF 说明书判断零件是否装反、步骤是否出错,或是否遗漏关键部件。来源显示,研究人员选取了三款宜家家具进行故意错误组装,并在不同阶段拍摄了共 60 张照片,用于评估模型的视觉和空间推理能力。
在测试过程中,模型不仅会获得现场照片,还会获得官方说明书、图片放大工具和 Python 解释器。它需要给出是否存在错误的判断,并指出具体的错误步骤和问题描述。评分采用多阶段验证,只要模型能够正确定位错误步骤,并大致说明问题,就可以获得相应分数。
- 输入信息:组装过程照片、官方 PDF 说明书、图片放大工具、Python 解释器。
- 核心任务:判断是否装错,并说明错误位置、步骤和问题。
- 能力重点:图像理解、空间关系判断、多步骤说明匹配。
- 应用指向:家具组装、设备安装、家电检修、汽车维修等场景。
GPT-6 Astra 领先,速度也有提升
测试结果显示,OpenAI GPT-6 Astra 以 80% 的准确率排名第一;Anthropic 的 Claude Fable 5.1 和 Claude Opus 5 分别达到 70% 和 61%。作为对比,来源提到,2025 年 11 月时领先模型 Claude Opus 4.5 的准确率仅为 28%,这意味着前沿多模态模型在约 10 个月内取得了显著提升。
除了准确率,GPT-6 Astra 的推理效率也有所改善。来源显示,它完成单张照片分析的中位耗时约为 3 分钟,是研究中速度最快的模型,并比此前领先模型快约 2 至 10 倍。不过,研究团队也认为,这一速度距离真正意义上的实时识别仍有差距。也就是说,AI 已经能较可靠地发现部分装配错误,但若要成为边看边指导的“实时维修助手”,仍需要进一步优化延迟和交互体验。
影响解读:多模态 AI 正从“看懂图片”走向“理解操作过程”
这类测试的意义在于,它把多模态 AI 的评估从静态识图推进到更接近真实世界的操作判断。家具安装、设备维护、零部件检修等任务,通常要求模型同时理解图片、说明文档、空间方向和步骤顺序。这比简单描述图片内容更难,也更接近 AI 助手在生产和生活中的实际价值。
如果类似能力继续提升,未来用户可能只需要用手机拍摄当前组装状态,AI 就能指出“这个板件方向不对”“某个螺丝漏装”或“接下来的步骤不应继续”。对企业而言,这也可能降低售后支持成本,并让复杂设备的安装与维护更依赖智能辅助系统。
不过,研究同样暴露了模型的差异化问题。来源显示,谷歌 Gemini 和阿里 Qwen 系列模型在该测试中几乎总是先假设存在错误,再尝试寻找错误;而早期 Anthropic 和 OpenAI 模型则常常完全找不到错误。这说明多模态模型不仅要提升识别能力,还需要更好的不确定性判断,避免“强行找茬”或“视而不见”。
中国模型的视觉推理仍需补课
在中国模型方面,来源称,目前表现最好的开源权重模型 Kimi K3 相比国际前沿模型约落后 7 个月,这一差距大于其在综合能力评估中约 4.4 个月的差距。研究认为,视觉推理能力仍是部分中国模型相对薄弱的方向。同时,DeepSeek V4 Pro、GLM 5.3 等热门模型暂未提供图像支持,也限制了它们参与此类多模态现实任务的评估。
整体来看,FAB 测试反映出一个明确趋势:前沿 AI 正在从文本问答、图片描述,进入“结合文档理解现实操作”的阶段。对于 AI 工具和产业应用而言,这类能力可能比单纯的聊天能力更重要,也将成为多模态模型竞争的新战场。