А тут напишем самую мякотку из результатов:
- В целом большие языковые мультимодальные нейросети мощь и с задачей справляются 💪
- ChatGPT лучшая среди и платных и открытых MLLM в задаче возраста, но всё ещё несколько сдаёт MiVOLO. Правда, это если закрыть глаза на то, что она просто отказывается работать с 21% рандомных и совершенно невинных изображений. На которых, скорее всего, показала бы сильно более высокую ошибку. И без учёта кучих других но.
- С полом у ChatGPT как-то неожиданно плохо, причём на эту тему успела незадолго до нашей выйти ещё одна независимая работа. На ещё более реалистичных данных из соц. сетей плохо прямо сильно.
- При ручном анализе мы заметили подозрительно много примеров, где у лиц мужского пола длинные волосы и на которых ChatGPT ошиблась. Выводы стоит попридержать - это просто наблюдение и многое зависит от промта, цепочки рассуждений и пр. Но задуматься точно есть о чём, возможно доигрались с системой безопасности или это особенности данных.
- Свежая LLaVA-NeXT 34B, предсказуемо, лучшая среди открытых по возрасту и просто лучшая по полу (если из коробки)✨. Вообще, почти у всех (💣) мультимодалок сильно хорошо с полом. Явно сказывается большее понимание контекста, мира и сложных фичей, чем у спец. моделей.
- При этом, у всех открытых моделей не очень хорошо с возрастом.
- MiVOLO всё ещё тащит, даже без учёта стоимости инференса. Но для спец. моделей всё равно плохая новость – оставшихся конкурентов ChatGPT расщепил бы на атомы.
- А если взять ShareGPT4V (на момент завершения работ тренировочный код для LLaVA-NeXT ещё не появился в доступе) и прямо с оригинальным лоссом натренировать на нашем датасете, то будет гига 🌿 на части бенчмарков. Детали в статье.
Post #80
850

- 👍 6
- 👏 1