Исследовательское подразделение Scale Labs в партнерстве с Elorian представило бенчмарк Humanity's Sixth Sense, созданный для проверки способности ИИ интерпретировать скрытые социальные сигналы и пространственные взаимосвязи на изображениях и видео.
Набор тестов состоит из 522 вопросов по 288 статичным сценам и 234 видеофрагментам (оценка габаритов разъезда автомобилей, мотивы поведения людей, негласная иерархия в кадре и т.д)
Испытания 25 актуальных мультимодальных моделей зафиксировали заметное отставание от человека.
Контрольная группа людей набрала 93,1% точности, лидирующая GPT-6 Astra - 53,6%. Результаты GPT-6.1 Sol и Claude Opus составили 46,6% и 44,6%, медиана по выборке - 30,9%.
Детальный разбор более 8,5 тысяч неудачных ответов показал, что 94% из них вызваны сбоями первичного машинного зрения - модели пропускают маркеры в кадре и теряют контекст. На ошибки в логике рассуждений пришлось всего 5%.
Увеличение вычислительного бюджета (в среднем 4000 токенов на ответ) не решило проблему, а иногда еще и снижало точность. Эмуляция фокусировки через кроп также дала минимальный эффект.
Scale Labs по итогу тестов пришли к выводу, что масштабирование логического вывода не компенсирует ограничения базовой архитектуры компьютерного зрения.
@ai_machinelearning_big_data
#news #ai #ml

