一項透過照片判斷家具組裝是否出錯的新測試,正作為衡量AI模型視覺推理能力的新方式受到關注。在這項測試中,OpenAI最新的模型GPT-6 Astra取得了遠超以往模型的成績,顯示AI在影像與空間認知方面的能力在不到一年的時間內實現了快速提升。

圍繞家具組裝錯誤設計的新測試

這項基準測試的做法是,讓AI模型讀取家具組裝過程中拍攝的照片,判斷組裝步驟中哪裡出現了錯誤。測試對象為複雜程度不同的三款家具,均由包含多個組裝步驟的套件構成。模型會取得組裝說明書的影像、放大檢視照片的功能,以及用於運算的程式執行環境,必須將每一步的照片與說明書逐一比對,找出所有錯誤並以文字說明問題所在。評分分為三個階段:發現錯誤、確認正確步驟、驗證回答內容。

這項測試看似簡單,但要求模型從照片中準確讀取零件方向、位置關係、是否漏鎖螺絲等細節,因此對AI模型而言是同時考驗視覺與空間認知能力的高難度課題。人類只要將照片與說明書比對就能一眼發現的錯誤,對模型來說卻必須先從影像中正確辨識相關零件及其方向,再將其轉化為文字表達,這牽涉多項能力的協同運作,而非單純的影像分類。

GPT-6 Astra拿下80%,10個月內大幅躍升

在這項測試中,GPT-6 Astra取得了80%的正確率,平均每題耗時約3分鐘,處理速度也優於其他主流模型。作為對照,Anthropic的Claude Fable 5.1得分為70%,Claude Opus 5為61%,顯示多家企業已在同一時期達到較高水準。

值得關注的是進步的速度。就在10個月前,同一測試的最高分還屬於Anthropic的Claude Opus 4.5,當時的正確率僅有28%。也就是說,這段期間內最高分增長至近三倍,清楚反映出AI模型影像理解能力在過去一年中的快速提升。另一方面,據稱中國主要企業發布的開源權重模型與最前沿模型相比,仍落後約七個月,顯示這項視覺推理領域的技術差距依然明顯。

邁向實用化的課題與更廣泛的應用可能

由於GPT-6 Astra目前處理一張照片仍需約3分鐘,尚不足以在組裝過程中提供即時指導。不過,這種視覺與空間推理能力被認為有望應用於結構相似的場景,例如判斷汽車故障部位或排查家電損壞原因。據悉,GPT-6 Astra在與機器人相關的視覺任務上也表現出色,顯示其具備超越單純影像辨識的通用空間理解能力。

GPT-6 Astra是OpenAI於2026年9月推出的最新旗艦模型,先前已陸續取得語音支援、內建金融資料等多項功能擴充。這次的基準測試結果顯示,除了這些實用層面的強化之外,模型從真實照片中讀取細節的基礎視覺能力本身也在穩步提升。

總結

在這項透過照片檢測家具組裝錯誤的專項基準測試中,OpenAI最新模型GPT-6 Astra取得了80%的高正確率,遠超同類模型。同一測試的最高分在10個月前僅有28%,顯示AI模型視覺與空間推理能力正快速進化。儘管受限於處理速度,即時應用仍有課題待解,但汽車維修、家電故障診斷等組裝以外的應用前景同樣值得期待。