Наткнулся на интересное исследование по галлюцинациям в современных моделях, которое меня зацепило.
Компания Vectara, которая некоторое ведет публичный лидерборд по галлюцинациям LLM (ссылка тут), обновила свой бенчмарк, а именно усложнила датасет, добавила более длинные документы из области права, медицины и финансов, то есть то, с чем реально работают enterprise системы.
И вот что выявил обновленный датасет: reasoning модели, которые сейчас позиционируются как самые мощные, показывают худшие результаты на задачах суммаризации с опорой на документы или контекст. GPT-5, Claude Sonnet 4.5, Grok-4 и Gemini-3-Pro все превысили 10% галлюцинаций.
Гипотеза тут простая. Reasoning модели думают над ответом и в процессе начинают добавлять выводы и связи, которых нет в исходных данных или контексте.
С точки зрения тестирования это очень важное наблюдение, потому что многие команды выбирают модель по общим бенчмаркам, а потом удивляются почему в конкретном сценарии система ведет себя не так как ожидалось. Тип задачи сильно влияет на поведение модели, и это нужно учитывать при создании ИИ систем.
⚡️⚡️Старт нового потока на курсе по тестированию ИИ - 7 мая! 🔥
Полезная информация:
Курс по evaluation AI |
Мой фреймворк для оценки AI |
С чего начать изучение AI | Инструменты для оценки AI |
Инструменты для оценки AI (ч.2)
Post #139
602

- 🔥 9