一句话结论
OpenAI GPT-6 Astra 在家具组装基准测试中准确率达 80%,多模态 AI 识别真实装配错误的能力大幅提升。
关键要点
- OpenAI GPT-6 Astra 在 Epoch AI 发布的家具组装基准测试(FAB)中以 80% 的准确率位居榜首,单张照片分析中位耗时约 3 分钟。
- Anthropic Claude Fable 5.1 和 Claude Opus 5 准确率分别为 70% 和 61%,显著高于 2025 年 11 月时 Claude Opus 4.5 的 28%。
- 测试使用 60 张宜家家具组装照片,要求 AI 将照片与官方 PDF 说明书、图片放大工具及 Python 解释器结合比对,找出错误位置并说明问题。
- 中国开源权重模型 Kimi K3 在国际前沿模型中约落后 7 个月,该差距大于其在综合能力评估中约 4.4 个月的差距。
- 谷歌 Gemini 与阿里 Qwen 系列模型在测试中几乎总是先假设存在错误再寻找错误;早期 Anthropic 和 OpenAI 模型则经常完全找不到错误。
背景与事实
Epoch AI 于 2026 年 9 月 23 日(当地时间)发布了一组家具组装基准测试(Furniture Assembly Benchmark,简称 FAB)结果。该测试专门评估 AI 理解现实世界装配过程的能力,测试团队选取三款宜家家具进行故意错误组装,并拍摄不同阶段照片,总计 60 张。测试要求 AI 模型将这些照片与官方安装说明书进行比对,找出错误位置并说明具体问题。
在测试资源方面,AI 不仅获得组装时的照片,还能同时使用官方 PDF 说明书、图片放大工具以及 Python 解释器。模型需要判断是否存在错误,并指出具体出错步骤和问题描述。评分采用多阶段验证机制,只要模型能够正确定位错误步骤并大致说明问题,即可获得相应分数。
测试结果显示,OpenAI GPT-6 Astra 以 80% 的准确率位居榜首,相比 2025 年底的提升近三倍。Anthropic Claude Fable 5.1 和 Claude Opus 5 分别达到 70% 和 61%。作为对比,2025 年 11 月时的领先模型 Claude Opus 4.5 准确率仅为 28%,意味着前沿模型在约 10 个月内实现了显著提升。
在推理效率方面,GPT-6 Astra 完成单张照片分析的中位耗时约为 3 分钟,是研究中速度最快的模型,比此前领先模型快约 2 至 10 倍。不过,研究团队认为,这一速度距离真正意义上的实时识别仍有一定差距。研究还分析了不同模型的错误模式,谷歌 Gemini 和阿里 Qwen 系列模型几乎总是先假设存在错误再去找错误;而早期 Anthropic 和 OpenAI 模型则相反,经常完全找不到错误。
在中国模型方面,目前表现最好的开源权重模型 Kimi K3 相比国际前沿模型约落后 7 个月,这一差距比其在综合能力评估中的约 4.4 个月差距更大。研究认为,视觉推理能力仍是当前部分中国模型相对薄弱的方向,而 DeepSeek V4 Pro、GLM 5.3 等热门模型暂未提供图像支持。
影响分析
对于中文开发者与从业者而言,这一测试结果意味着多模态 AI 在结合图像和技术说明进行判断的任务上已具备实际落地潜力。汽车维修、家电检修、设备安装等需要结合图像和技术说明进行判断的场景,开发者可以参考 FAB 的测试框架来评估自己集成的大模型在实际工况下的表现。
从工程实践角度看,GPT-6 Astra 单张照片 3 分钟的中位耗时虽然比此前快 2 至 10 倍,但仍需数分钟时间,这决定了它目前更适合非紧急的离线或准实时辅助场景,如用户提交问题后等待分析结果,而非行车安全或紧急维修指导等对延迟极度敏感的场景。对于依赖中国开源模型的开发者,Kimi K3 在视觉推理方向上落后国际前沿 7 个月的判断提示,在构建涉及复杂空间推理和图纸比对的系统时,需评估该差距对业务准确率的具体影响,或考虑使用支持图像输入的其他模型作为过渡方案。
适用边界
该结论仅适用于基于照片与官方 PDF 说明书比对、且允许使用图片放大工具和 Python 解释器的家具组装错误识别场景。测试结果不能直接外推至以下场景:需要实时视频流处理的即时纠错系统(因当前速度距离真正实时识别仍有差距);非宜家品牌家具的组装检测(测试仅使用三款宜家家具);以及 DeepSeek V4 Pro、GLM 5.3 等暂未提供图像支持的模型在该类视觉推理任务中的表现评估。此外,关于不同家具难度与宜家复杂度指数无明显关联的结论,仅基于本次测试的三款特定家具,可能不具普遍代表性。
孤本观察
编辑判断显示,本次测试中模型错误模式的显著分化(假设错误 vs 完全找不到错误)比准确率排名更值得关注,因为它揭示了当前多模态模型在缺乏明确错误先验时的推理稳定性问题,这一特征可能比单纯的准确率数字对开发者评估模型实际可用性更具参考价值。







常见问题
Epoch AI 家具组装基准测试中,GPT-6 Astra 的准确率是多少?
OpenAI GPT-6 Astra 在该测试中以 80% 的准确率位居榜首。
测试中 AI 模型可以使用哪些辅助资源来识别家具组装错误?
AI 模型可以结合官方 PDF 说明书、图片放大工具及 Python 解释器进行比对分析。
GPT-6 Astra 分析单张组装照片的中位耗时大约多久?
GPT-6 Astra 完成单张照片分析的中位耗时约为 3 分钟。
中国开源模型 Kimi K3 在国际前沿模型中的视觉推理能力落后多少?
Kimi K3 相比国际前沿模型约落后 7 个月,该差距大于其综合能力评估中约 4.4 个月的差距。
谷歌 Gemini 和阿里 Qwen 系列模型在测试中表现出什么样的典型错误模式?
这两个系列的模型几乎总是先假设存在错误再寻找错误,而早期模型则经常完全找不到错误。
来源:IT之家