Исследователи показали, что флагманские мультимодальные модели уверенно описывают детали несуществующих изображений и набирают до 80% баллов визуальных бенчмарков, опираясь исключительно на текстовые паттерны. В медицинских задачах это приводит к галлюцинаторным диагнозам тяжёлых патологий при неудачной загрузке картинки. Чисто текстовая модель на три миллиарда параметров обошла все флагманские решения и рентгенологов на тестах с рентгеновскими снимками. Авторы предлагают фреймворк B-Clean, который отсеивает скомпрометированные вопросы и меняет рейтинги моделей.
Читать полностью
@chernovdev
Post #2063
553
