Epoch AI провели тест FAB (Furniture Assembly Benchmark) — нейросети должны были найти ошибки в сборке мебели IKEA по фотографиям. 😎
Лучший результат за 10 месяцев вырос с 28% до 80% — рывок, который говорит о прогрессе в пространственном мышлении моделей. 😇
Как проходил тест?
• 60 фото трёх предметов IKEA (стеллаж, каркас кровати, комод)
• Модели получали инструкцию, зум и Python-интерпретатор
• Нужно было указать этап с ошибкой и описать её
• Лимит — 80 шагов в агентной песочнице
Результаты:
• GPT-6 Astra — 80% (самый быстрый: 3 минуты на фото)
• Claude Fable 5.1 — 70%
• Claude Opus 5 — 61%
• Китайские открытые модели (Kimi K3) отстают на 7 месяцев
Что выяснили: сложность сборки (индекс IKEA) не коррелировала с успехом модели. Важнее оказались неочевидность ошибки, угол обзора и то, насколько далеко продвинулась сборка после ошибки. 😐
Gemini и Qwen склонны находить ошибки там, где их нет, а ранние GPT и Claude — наоборот, пропускали реальные. 🧐
👍 — скоро ИИ будет собирать мебель вместо нас
🔥 — 80% точности — а оставшиеся 20% кто исправлять будет?
🧡💛💚💙💜
@DH_LIINK
