TGViewer
LawCoder LawCoder @law_coder · 1.17K subscribers
Post #380 781
Если вы как и я любите стравить нейросети скармливая их ответы другу другу с просьбой покритиковать, то знайте — это верный путь, но даже он не гарантирует объективности.

Свежее исследование ACL 2026 «Prior Prejudice» показывает, что LLM-судьи катастрофически предвзяты и часто оценивают не логику, а совпадение со своими «убеждениями».

В 88% случаев модель прямо признает в рассуждениях, что в тексте нет доказательств, но всё равно ставит высший балл, если согласна с выводом. Она буквально пишет: «Аргументов нет, но это общепринятая истина, так что 6/7».

При этом этап обучения на человеческих предпочтениях (DPO) не исправляет ситуацию, а критически усиливает предвзятость. Модель становится более «упрямой» в своих скрытых симпатиях.

Попытка заставить модель «сначала подумать» (Chain of Thought) часто в 40% случаев только увеличивает разрыв в оценках — модель просто находит более изощренные способы оправдать свои предубеждения.

И в целом это довольно логично, просто теперь еще подтверждено исследованиями, но вот что меня удивило: если забрать ответ из одного чатика и перенести в другой, тем самым обнулив контекст, это не поможет, т.к. согласно вот этому исследованию модель узнаёт собственный текст по статистике токенов даже без подсказок. В итоге Sonnet, ревьювящий Haiku, будет лоялен к нему просто потому, что они из одного семейства.

В исследованиях также подчеркивается, что такие скрытые предпочтения невозможно стереть обычным «обучением безопасности» — они всё равно вылезают, когда модель выступает в роли судьи. Так что «перекрёстный допрос» разными моделями — это необходимость, но нужно учитывать, что они могут подыгрывать «своим» или просто поддакивать тому, во что их научили верить.

LawCoder
  • 🔥 5
  • ❤ 3
  • 😁 3
  • 👀 2
  • 👍 1
More from @law_coder
  1. Sep 18, 2026Когда зашёл прочитать пятничный инсайт, а там два поста и много букв, понимаю вас, коллеги…
  2. Sep 18, 2026Пятничный инсайт Часть 2 У нас уже есть задокументированный случай, когда студент вышел из…
  3. Sep 18, 2026Пятничный инсайт Бесконечно скучно от того, что в сфере ИИ нет движения в сторону западног…
  4. Sep 11, 2026Пятничный инсайт Главный вопрос которого: "С чего вы взяли, что отобрав рутину, сделаете н…
  5. Sep 10, 2026В следующий раз когда кто-то вам скажет: хоспаде, успокойся ты уже со своей конфиденциальн…
  6. Sep 9, 2026Для тех, у кого, как и у меня, закончилось место на телефоне, но очень хочется установить…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →