宜家螺丝拧反了AI能看出来吗?一份新基准测试给出了答案

组装宜家家具这件事,难倒过无数人——而现在,它也成了检验AI视觉推理能力的一块试金石。 Epoch AI在9月23日发布了一项名为FAB(家具组装基准测试)的评测结果。测试思路并不复杂:研究人员故意将三款宜家家具装错,在不同阶段拍照,再把照片连同官方PDF说明书一起交给AI,让它判断哪一步出了问题、问题具体是什么。AI还可以调用图片放大工具和Python解释器来辅助分析。

整套流程用60张照片、多阶段评分来量化模型的视觉理解与空间推理能力。 成绩单里,OpenAI的GPT-6 Astra以80%准确率排在第一,Anthropic的Claude Fable 5.1和Claude Opus 5分别拿到70%和61%。对照组很能说明问题:2025年11月时表现最好的Claude Opus 4.5,当时的准确率只有28%。也就是说,不到一年的时间,前沿模型在这类任务上的表现翻了将近三倍。

速度上,GPT-6 Astra分析单张照片的中位耗时约3分钟,是参测模型中最快的,比此前领先模型快2到10倍。研究团队指出,这个速度距离真正的"实时识别"仍有距离。 不同模型的失误模式也很有意思。谷歌Gemini和阿里Qwen系列倾向于预设有错误再去找依据;而早期的Anthropic和OpenAI模型则走向另一个极端,往往完全检测不到错误。

两种偏差方向截然相反,但都指向同一个问题——模型还没学会在"没有错误"和"错误不明显"之间做准确区分。 中国模型方面,开源权重模型里表现最好的Kimi K3,与国际前沿的差距约为7个月。这个数字比它在综合能力评估中约4.4个月的差距更大,说明视觉推理是当前部分中国模型的相对短板。DeepSeek V4 Pro和GLM 5.3目前还不支持图像输入,因此未在此次测试中参与比较。

值得继续关注的变化

FAB测试真正有价值的地方,不在于哪家模型拿了第一,而在于它测的是一件非常具体的事:AI能不能用眼睛而不是记忆来理解操作现场。 过去评估多模态模型,图像往往只是辅助——模型靠语言理解占大头,图像提供补充线索。FAB把这个比例翻过来了。说明书是固定文本,而照片里藏着的才是关键:一个螺丝拧错了方向,一块板子装反了,一个步骤跳过了。要发现这些,AI必须在图像坐标系里做空间推理,而不是在语言空间里做匹配。

80%的准确率意味着每十个错误里还有两个会被漏掉,这在真实维修场景里仍然不够可靠——但28%到80%这条增长曲线说明的是,这个方向上的天花板还没被触及。 研究团队发现,家具的"宜家复杂度指数"并不能预测AI的表现,真正影响难度的是错误的隐蔽程度、拍摄视角以及后续步骤是否把初始错误遮蔽了。这个发现对工程侧有直接意义——如果要把类似能力部署到实际场景,问题设计和摄像头位置比零件数量更关键。 模型的两种相反偏差值得细看。

Gemini和Qwen系列"总是先假定有错再找证据",这在工程检修语境里可能是合理的保守策略,但在精度要求高的场合会带来大量误报,徒增人工复核成本。早期Anthropic和OpenAI模型"经常找不到错误",则是另一种代价——漏报在需要安全保障的场合更危险。两种偏差没有哪个天然更好,关键在于使用场景对假阳性和假阴性的容忍度各是多少。目前的测试只给出了准确率,还没有拆分这两类错误的比例,这是解读数字时需要保留的空间。

中国模型在这项测试里落后的原因有结构性一面。DeepSeek和GLM的热门版本此次无法参测,本身说明视觉输入支持在这些模型的迭代优先级里暂时靠后。Kimi K3的7个月差距,比综合能力上的4.4个月差距更大,侧面印证了视觉-空间推理这条技术路线上的积累周期更长、不能靠语言侧的强大表现来抵消。对于正在追赶的团队来说,这不是一个用更多数据就能迅速弥补的缺口,而是对模型架构和训练范式的更根本要求。

3分钟完成一张照片的分析,目前看够用于事后复核,但不够用于实时引导。把这个时间压到秒级,才谈得上真正的"边装边问AI"。这件事技术上不是做不到,但意味着又一轮算力和工程投入。

©著作权归作者所有,转载或内容合作请联系作者
【社区内容提示】社区部分内容疑似由AI辅助生成,浏览时请结合常识与多方信息审慎甄别。
平台声明:文章内容(如有图片或视频亦包括在内)由作者上传并发布,文章内容仅代表作者本人观点,简书系信息发布平台,仅提供信息存储服务。

友情链接更多精彩内容