MIRA: Multimodal Imagination for Reasoning Assessment
Представили новый бенчмарк для проверки «воображения» ИИ - умения рассуждать, рисуя и визуализируя мыслительный процесс, а не только отвечая текстом.
В наборе: 546 задач по геометрии, физике, логическим головоломкам и причинным связям.
Модели должны думать через эскизы, схемы и визуальные шаги, а не просто словами.
Режимы тестирования:
• Direct — модель отвечает напрямую
• Text-CoT — текстовый chain-of-thought
• Visual-CoT — модель рассуждает через рисунки и визуальные шаги
Ключевые результаты:
• Ни одна модель не превысила 20% точности в Direct-режиме (GPT-5 ~16.5%)
• Text-CoT часто ухудшает результат (например, −18% у Gemini 2.5 Pro)
• Visual-CoT даёт средний прирост +33.7%, особенно заметный в задачах по физике
Вывод прост и важен:
ИИ становится умнее, когда может воображать и рисовать, а не только писать текст.
Будущее reasoning-моделей - в визуальном мышлении.
PAPER: https://arxiv.org/abs/2511.02779
PROJECT: https://mira-benchmark.github.io
Post #1595
1.88K

- ❤ 6
- 🔥 3
- 👍 1