Смешное из мира Vision Language Models
https://arxiv.org/abs/2603.21687
Ребята обнаружили что эти ваши Gemini, Claude, ChatGPT, и подобное, в следствие архитектуры того как их обучают видеть изображения, будут отвечать на вопросы разряда "определи тип опухоли на скане" уверенным ответом, даже если изображение вообще не было прикреплено
Аля модели сильно склонены что, если вопрос о картинке, то картинка естественно есть
В том числе это значит что модельки большую часть умозаключений для ответа извлекают исключительно из постановки вопроса, и "какой ответ ожидается на такой вопрос" в изоляции от самого изображения
В работе это уже понаблюдал — если дать VLM картинку и описать задачу разряда "ты должен определять критерии по которым это изображение не соответствует таким-то правилам", то оно будет ооочень сильно склонно находить проблемы, даже если с изображением все хорошо
Грубо говоря "найди что не так" подразумевает "что-то не так" сильно более вероятно. И судит более критично
Post #3110
3.19K
