TGViewer
AI Forge – про ИИ в бизнесе AI Forge – про ИИ в бизнесе @ai_forge · 258 subscribers
Post #137 181

Forwarded from Datalytics

Как по всему GPT расползись гоблины

В общем, у чатагпт есть разные настройки личности. Одна из таких личностей — это «Nerdy». По-нашему, ботан. Модель в этом режиме становится излишне занудной, но при этом такой а ля глубокой и игривой. Её ключевая фишка в том, чтобы пользователь посмотрел на мир с немного странноватой и несерьезной точки зрения

Когда обучают модели, то используют разметку — либо автоматическую, либо ручную. Как оказалось, на этапе разметки датасета для личности «Nerdy» хорошие оценки ставили таким ответам, в которых есть какие-то фантастические твари типа гоблинов, единорогов и троллей. Это не то, чтобы специально произошло, то есть в инструкции не было явно указано: если ответ содержит «гоблина» — ставь лайк. Но по какому-то стечению обстоятельств именно такие ответы больше цепляли разметчиков

Как итог режим «Nerdy» стал питать исключительную слабость к сказочным долбаебам существам. Проблема тут в том, что модели не обучают под каждый режим отдельно — есть единая «тушка», которую обучают под все режимы сразу. Слишком дорого было бы обучать под каждый профиль отдельную модель. Потом системный промпт задаёт контекст, который смещает вероятности следующих токенов, нужных для качественной работы в стиле «ботана»

Отдельно стоит заметить про техническую особенность обучения, которая сделала эффект таким сильным. Когда модель обучают, то часто используют так называемые rollouts. Это процесс, при котором модель генерирует примеры, которые дальше размечаются и идут в обучение. И вот тут самый цимес: модель «инфицированная» гоблинами начинает чуть чаще создавать генерации с гоблинами → эти ответы проходят оценку и получают балл выше по каким-то другим причинам (например, структура и детальность ответа) → попадают в обучающие данные → модель начинает вставлять гоблинов ещё чаще. И дальше по кругу: в rollouts гоблины встречаются ещё чаще

В результате этого обычная GPT 5-1 (без включенного режима «ботана») начала выдавать слово «гоблин» сильно чаще чем это нужно: использование слова «goblin» выросло на 175% (а «gremlin» — на 52%, какая-то незаслуженная дискриминация гремлинов). Это при том, что доля ответов ChatGPT с помощью личности «Nerdy» составляла всего 2,5% и давал 66% всех упоминаний слова «гоблин» по всем диалогам чатагпт

Как финал «гремлинов» и «гоблинов» почистили (и заменили на марсиан и рептилоидов) — саму личность «Nerdy» убрали, а обучающие данные отфильтровали. Ещё при анализе в GPT-5.5 нашли целый зоопарк — еноты, тролли, орки и голуби (в чем магия голубей не знаю). В OpenAI признают, что GPT 5.5 обучался всё ещё на этом зоопарке, поэтому пришлось запилить отдельную инструкцию, которая подавляла бы гоблинов и прочую живность

Мораль сей басни в том, что этот механизм может проявится не только в виде «гоблинов». Опаснее, когда у нас появляется устойчивая предвзятость, которую не так просто обнаружить, например, какой-то не очень полезный совет в рамках ответов на медицинские вопросы пользователей. И для меня эта история — сильная иллюстрация того, что любые модели искусственного интеллекта — это прежде всего набор статистических закономерностей. Они не «понимают», они оптимизируют то, что им явно указали, но при этом «схватывают» и неявное, а объяснить что именно «схватили» — не могут. И получается, что от качества обучающих выборок и процесса дальнейшей валидации на стороне провайдера (в данном случае OpenAI) будет зависеть будет ли ответ на важный для вас вопрос, сделанный с помощью ChatGPT, пестрить гоблинами, павлинами и прочими дивностями или даже вредными советами
  • ❤ 1
More from @ai_forge
  1. Aug 31, 2026⚡️ Вебинар: «Dora от FanRuan: от GenAI к Agentic AI в корпоративной аналитике» – 3 сентябр…
  2. Jun 15, 2026AI-компании начали менять токены на доли в компаниях В мае 2026 OpenAI предложила каждому…
  3. Dec 5, 2025📊 Anthropic опросила 1,250 профессионалов об использовании ИИ на работе Главные цифры: —…
  4. Nov 13, 2025OpenAI релизнули модельки GPT-5.1, которые обещают быть в своей тональности «теплее и боле…
  5. Oct 21, 2025Делюсь новостью С июня 2025 года я присоединился к Т-Банку в роли продуктового лида LLM-пл…
  6. Sep 2, 2025Решил завести канал для вакансий про LLM... 🤖 Рынок LLM-приложений развивается с космичес…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →