Если вы как и я любите стравить нейросети скармливая их ответы другу другу с просьбой покритиковать, то знайте — это верный путь, но даже он не гарантирует объективности.
Свежее исследование ACL 2026 «Prior Prejudice» показывает, что LLM-судьи катастрофически предвзяты и часто оценивают не логику, а совпадение со своими «убеждениями».
В 88% случаев модель прямо признает в рассуждениях, что в тексте нет доказательств, но всё равно ставит высший балл, если согласна с выводом. Она буквально пишет: «Аргументов нет, но это общепринятая истина, так что 6/7».
При этом этап обучения на человеческих предпочтениях (DPO) не исправляет ситуацию, а критически усиливает предвзятость. Модель становится более «упрямой» в своих скрытых симпатиях.
Попытка заставить модель «сначала подумать» (Chain of Thought) часто в 40% случаев только увеличивает разрыв в оценках — модель просто находит более изощренные способы оправдать свои предубеждения.
И в целом это довольно логично, просто теперь еще подтверждено исследованиями, но вот что меня удивило: если забрать ответ из одного чатика и перенести в другой, тем самым обнулив контекст, это не поможет, т.к. согласно вот этому исследованию модель узнаёт собственный текст по статистике токенов даже без подсказок. В итоге Sonnet, ревьювящий Haiku, будет лоялен к нему просто потому, что они из одного семейства.
В исследованиях также подчеркивается, что такие скрытые предпочтения невозможно стереть обычным «обучением безопасности» — они всё равно вылезают, когда модель выступает в роли судьи. Так что «перекрёстный допрос» разными моделями — это необходимость, но нужно учитывать, что они могут подыгрывать «своим» или просто поддакивать тому, во что их научили верить.
LawCoder
Post #380
781
- 🔥 5
- ❤ 3
- 😁 3
- 👀 2
- 👍 1