💡 У вас не появилось ощущение что модели Ai стали выдавать все более скучные ответы?
Есть уже популярное мнение: «AI стал скучным, потому что его задушили выравниванием». Типа RLHF, safety и всё такое — и модели потеряли креативность.
Звучит логично. Но, как выяснилось, всё немного интереснее.
Ребята из Stanford University разобрали тысячи человеческих оценок (датасет HelpSteer) и нашли неожиданное: проблема не в моделях, а в людях.
Когда мы оцениваем ответы, мы выбираем не лучший — а самый привычный. Самый «нормальный». Самый ожидаемый.
И модель просто учится этому соответствовать. Мы сами постепенной учим модели быть отстойными 😀
Отсюда и эффект: просишь «шутку» — получаешь максимально безопасную и предсказуемую версию. Не потому что модель не умеет лучше, а потому что так её научили.
Но вот где начинается магия.
Если вместо:
«Напиши шутку про кофе»
попросить:
«Сгенерируй 5 шуток про кофе с вероятностями»
— модель внезапно начинает выдавать сильно более разнообразные и креативные ответы.
Почему?
Потому что ты просишь не «лучший ответ», а выборку из распределения. И она достает то, что было «спрятано» после выравнивания.
Результаты в исследовании (там есть PDF):
— до 2× рост разнообразия
— до +25% в человеческой оценке качества
— до 66% восстановления «креативности» базовой модели
И самое интересное: чем мощнее модель — тем больше у неё «запертой» креативности.
Вывод получается довольно неожиданный.
AI не стал тупее, модель не стала скучной.
Ты просто каждый раз просишь её быть «нормальной» 😄
Сайт: verbalized-sampling.com
Post #148
72