VLM Survey
Использование мультимодальных подходов, в первую очередь изображения плюс текст, все активнее становится ключевой киллер фичей при разработке general моделей.
Недавно еще крышесносные LLM-чаты уже не воспринимаются как полноценные решения, если в них нет поддержки изображений.
Я планирую сделать серию постов про VLM (vision-language models) и начать я бы хотел с технического обзора статей, обеспеченных мировым сообществом к сегодняшнему дню.
Если вы специалист в ML и хотите разобраться в том, что понаписали про VLM, я отоборал вам самую мякотку, одна статья, чтобы зайти в новую сферу.
Чтобы не писать один огромный пост в тг - все красиво оформил здесь. Заходите и оценивайте!
Думаю это мой самый проработанный и энергозатратный пост. Мне будет приятно, если вы поделитесь им со своими знакомыми, ведь материал и правда, кажется, получился неплохой.
Если я упустил что-то важное - напишите, пожалуйста, об этом в комментариях. Есть идея еще пособирать материала и написать статью на habr, поэтому ваши правки и замечания будут очень полезны!
Лайк, подписка, колокольчик и до новых встреч!
@lechim_ai
Post #29
1.45K