一项通过照片判断家具组装是否出错的新测试,正作为衡量AI模型视觉推理能力的新方式受到关注。在这项测试中,OpenAI最新的模型GPT-6 Astra取得了远超以往模型的成绩,显示出AI在图像与空间认知方面的能力在不到一年的时间里实现了快速提升。

围绕家具组装错误设计的新测试

这项基准测试的做法是,让AI模型读取家具组装过程中拍摄的照片,判断组装步骤中哪里出现了错误。测试对象为复杂程度不同的三款家具,均由包含多个组装步骤的套件构成。模型会获得组装说明书的图像、放大查看照片的功能,以及用于计算的代码执行环境,需要将每一步的照片与说明书逐一对照,找出所有错误并用文字说明问题所在。评分分为三个阶段:发现错误、确认正确步骤、验证回答内容。

这项测试看似简单,但要求模型从照片中准确读取零件朝向、位置关系、是否漏拧螺丝等细节,因此对AI模型而言是同时考验视觉与空间认知能力的高难度任务。人类只需将照片与说明书对照就能一眼发现的错误,对模型来说却需要先从图像中正确识别相关零件及其朝向,再将其转化为文字表达,这涉及多个能力的协同运作,而非单纯的图像分类。

GPT-6 Astra拿下80%,10个月内实现大幅跃升

在这项测试中,GPT-6 Astra取得了80%的正确率,平均每道题耗时约3分钟,处理速度也优于其他主流模型。作为对比,Anthropic的Claude Fable 5.1得分为70%,Claude Opus 5为61%,显示出多家企业已在同一时期达到较高水平。

值得关注的是进步的速度。就在10个月前,同一测试的最高分还属于Anthropic的Claude Opus 4.5,当时的正确率仅为28%。也就是说,这段时间内最高分增长至近三倍,清楚地反映出AI模型图像理解能力在过去一年中的快速提升。另一方面,据称中国主要企业发布的开源权重模型与最前沿模型相比,仍落后约七个月,说明这一视觉推理领域的技术差距依然明显。

走向实用化的课题与更广泛的应用可能

由于GPT-6 Astra目前处理一张照片仍需约3分钟,尚不足以在组装过程中提供实时指导。不过,这种视觉与空间推理能力被认为有望应用于结构相似的场景,例如判断汽车故障部位或排查家电损坏原因。据悉,GPT-6 Astra在与机器人相关的视觉任务上也表现出色,显示出其具备超越单纯图像识别的通用空间理解能力。

GPT-6 Astra是OpenAI于2026年9月推出的最新旗舰模型,此前已陆续获得语音支持、内置金融数据等多项功能扩展。此次的基准测试结果表明,除了这些实用层面的强化之外,模型从真实照片中读取细节的基础视觉能力本身也在稳步提升。

总结

在这项通过照片检测家具组装错误的专项基准测试中,OpenAI最新模型GPT-6 Astra取得了80%的高正确率,远超同类模型。同一测试的最高分在10个月前仅为28%,显示出AI模型视觉与空间推理能力正在快速进化。尽管受限于处理速度,实时应用仍有课题待解决,但汽车维修、家电故障诊断等组装以外的应用前景同样值得期待。