ИИ видит картинку, но не понимает сцену
Представлен инструмент для проверки способности ИИ считывать неявные сигналы в изображениях и видео. Тест состоит из 522 заданий, разбитых на 288 статичных сцен и 234 видеофрагмента. Моделям задают вопросы, которые человек решает интуитивно: пройдёт ли автомобиль в зазор между припаркованными машинами, кто в комнате обладает негласной властью, каковы намерения человека в кадре.
Результаты испытаний 25 актуальных мультимодальных моделей зафиксировали радикальный разрыв с человеком. Лучшая доступная модель отвечает на вопросы чуть лучше случайного выбора.
Контрольная группа людей набрала 93,1% точности. Лидер среди моделей, GPT-6 Astra, показала 53,6%. GPT-6.1 Sol остановился на 46,6%, Claude Opus 5.5 — на 44,6%.
94% ошибок вызваны не слабостью рассуждений, а особенностью машинного зрения: модель просто не замечает визуальные маркеры и теряет контекст.
Попытки лечить проблему наращиванием вычислительного бюджета — в среднем 4 000 токенов на ответ — не сработали.
Post #214751
10.5K

- 👀 28
- ❤ 22
- 😁 13
- 👍 2
- 😢 2
- 👌 2
- 🔥 1
- 🤬 1