TGViewer
Big Data AI Big Data AI @bigdatai · 18.2K subscribers
Post #1595 1.88K
MIRA: Multimodal Imagination for Reasoning Assessment

Представили новый бенчмарк для проверки «воображения» ИИ - умения рассуждать, рисуя и визуализируя мыслительный процесс, а не только отвечая текстом.

В наборе: 546 задач по геометрии, физике, логическим головоломкам и причинным связям.
Модели должны думать через эскизы, схемы и визуальные шаги, а не просто словами.

Режимы тестирования:
• Direct — модель отвечает напрямую
• Text-CoT — текстовый chain-of-thought
• Visual-CoT — модель рассуждает через рисунки и визуальные шаги

Ключевые результаты:
• Ни одна модель не превысила 20% точности в Direct-режиме (GPT-5 ~16.5%)
• Text-CoT часто ухудшает результат (например, −18% у Gemini 2.5 Pro)
• Visual-CoT даёт средний прирост +33.7%, особенно заметный в задачах по физике

Вывод прост и важен:
ИИ становится умнее, когда может воображать и рисовать, а не только писать текст.
Будущее reasoning-моделей - в визуальном мышлении.

PAPER: https://arxiv.org/abs/2511.02779
PROJECT: https://mira-benchmark.github.io
  • ❤ 6
  • 🔥 3
  • 👍 1
More from @bigdatai
  1. Sep 29, 2026🚨 Anthropic в документах для инвесторов прямо предупреждает о рисках собственных ИИ-модел…
  2. Sep 29, 20265 октября начнется 19-й поток программы Data Engineer от Newprolab Программа для junior- и…
  3. Sep 28, 2026⚡️ Anthropic вернулась: новый Sonnet быстрее и дешевле, а по качеству почти догнал Opus 5.…
  4. Sep 28, 2026✔️ Data-платформа постепенно превращается в конструктор Для AI и Big Data уже недостаточно…
  5. Sep 28, 2026✔️ Переехали на Claude Opus 5.5, а `CLAUDE.md` остался со времён старых моделей? В Claude…
  6. Sep 28, 2026📚За 146 часов обучения покажем на практике, как внедрять модели машинного обучения в рабо…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →