В общем, у чатагпт есть разные настройки личности. Одна из таких личностей — это «Nerdy». По-нашему, ботан. Модель в этом режиме становится излишне занудной, но при этом такой а ля глубокой и игривой. Её ключевая фишка в том, чтобы пользователь посмотрел на мир с немного странноватой и несерьезной точки зрения
Когда обучают модели, то используют разметку — либо автоматическую, либо ручную. Как оказалось, на этапе разметки датасета для личности «Nerdy» хорошие оценки ставили таким ответам, в которых есть какие-то фантастические твари типа гоблинов, единорогов и троллей. Это не то, чтобы специально произошло, то есть в инструкции не было явно указано: если ответ содержит «гоблина» — ставь лайк. Но по какому-то стечению обстоятельств именно такие ответы больше цепляли разметчиков
Как итог режим «Nerdy» стал питать исключительную слабость к сказочным
Отдельно стоит заметить про техническую особенность обучения, которая сделала эффект таким сильным. Когда модель обучают, то часто используют так называемые rollouts. Это процесс, при котором модель генерирует примеры, которые дальше размечаются и идут в обучение. И вот тут самый цимес: модель «инфицированная» гоблинами начинает чуть чаще создавать генерации с гоблинами → эти ответы проходят оценку и получают балл выше по каким-то другим причинам (например, структура и детальность ответа) → попадают в обучающие данные → модель начинает вставлять гоблинов ещё чаще. И дальше по кругу: в rollouts гоблины встречаются ещё чаще
В результате этого обычная GPT 5-1 (без включенного режима «ботана») начала выдавать слово «гоблин» сильно чаще чем это нужно: использование слова «goblin» выросло на 175% (а «gremlin» — на 52%, какая-то незаслуженная дискриминация гремлинов). Это при том, что доля ответов ChatGPT с помощью личности «Nerdy» составляла всего 2,5% и давал 66% всех упоминаний слова «гоблин» по всем диалогам чатагпт
Как финал «гремлинов» и «гоблинов» почистили (и заменили на марсиан и рептилоидов) — саму личность «Nerdy» убрали, а обучающие данные отфильтровали. Ещё при анализе в GPT-5.5 нашли целый зоопарк — еноты, тролли, орки и голуби (в чем магия голубей не знаю). В OpenAI признают, что GPT 5.5 обучался всё ещё на этом зоопарке, поэтому пришлось запилить отдельную инструкцию, которая подавляла бы гоблинов и прочую живность
Мораль сей басни в том, что этот механизм может проявится не только в виде «гоблинов». Опаснее, когда у нас появляется устойчивая предвзятость, которую не так просто обнаружить, например, какой-то не очень полезный совет в рамках ответов на медицинские вопросы пользователей. И для меня эта история — сильная иллюстрация того, что любые модели искусственного интеллекта — это прежде всего набор статистических закономерностей. Они не «понимают», они оптимизируют то, что им явно указали, но при этом «схватывают» и неявное, а объяснить что именно «схватили» — не могут. И получается, что от качества обучающих выборок и процесса дальнейшей валидации на стороне провайдера (в данном случае OpenAI) будет зависеть будет ли ответ на важный для вас вопрос, сделанный с помощью ChatGPT, пестрить гоблинами, павлинами и прочими дивностями или даже вредными советами
