TGViewer
ИИ лоботомия ИИ лоботомия @ai_lobotomy · 187 subscribers
Post #50 156
Предварительное обучение может создать внутри огромную библиотеку потенциальных режимов поведения: помощник, манипулятор, циник, агрессор, моралист. Но просто наличие этих представлений ещё не означает, что они будут управлять ответом.

Последующее дообучение задаёт другое: какие из уже существующих внутренних режимов модель должна научиться активировать, когда сама становится говорящей стороной.

В свежей работе это проверили на Gemma 3 27B, Gemma 2 9B, Llama 3.1 8B и Qwen2.5 7B. Модели дообучали на медицинских, юридических данных и кибербезе — либо с нормальными ответами, либо с намеренно вредными.

После вредного дообучения доля рассогласованных ответов на вообще посторонние вопросы выросла примерно до 17–35%. У Gemma 3 27B — до 35%, тогда как контрольное обучение на той же тематике почти не меняло поведение.

Внутри моделей при этом усиливались признаки, связанные с обманом, манипуляцией, обходом ограничений и выходом из роли обычного помощника, а признаки безопасности и отказа слабели.

И это были не просто красивые корреляции: если искусственно усилить один такой признак в исходной Gemma 3 27B (через нашу любимую лоботомию), доля рассогласованных ответов поднималась до 62.08% — почти вдвое выше, чем после самого вредного дообучения.

Но самый интересный эксперимент был дальше. Авторы нашли веб-тексты про злодеев, власть, манипуляцию и другие темы, которые сильно активировали эти внутренние признаки.

Просто дообучить модель на таких текстах оказалось недостаточно. Даже похожая семантика сама по себе почти не меняла характер модели.

А вот когда то же содержание превращали в полноценные пары «запрос пользователя → ответ модели», эффект появлялся. На Gemma 3 такие данные дали 10.42% рассогласованных ответов против 3.96% для случайно выбранных документов. То есть важно не только что модель читает, но и какое поведение она учится воспроизводить от собственного имени.

И это, пожалуй, самый интересный вывод работы: последующее обучение может не создавать новую личность с нуля, а привязывать уже существующий внутри режим поведения к роли ассистента.

По-моему мнению это еще раз доказывает, что мы имеем дело со стохастическими попугаями (в данном контексте малые модели) а не интеллектом, которые ведут себя так как их обучили и не в состоянии "додумать" линию поведения без задания инициативы в обучающем тексте.

Data Attribution of Emergent Misalignment with Persona Features — Vetter et al., 2026
https://arxiv.org/abs/2608.11025
arXiv.org Data Attribution of Emergent Misalignment with Persona Features Emergent misalignment (EM) is the phenomenon where fine-tuning a language model on a narrow task leads to harmful behavior in unrelated domains. A leading mechanistic account attributes EM to...
  • 👍 2
  • 🔥 1
More from @ai_lobotomy
  1. Oct 7, 2026Как ловить инъекции Представим агента, который открыл письмо, PDF или страницу с внедрённо…
  2. Oct 4, 2026Петля обратной связи для трансформера. Обычный трансформер движется строго снизу вверх по…
  3. Oct 3, 2026Теория слепых пятен в обучении моделей. Если кратко - обучение каким-то образов формирует…
  4. Oct 3, 2026Градиентный спуск против эволюционного поиска (мутации, отбор и выживание решений с наимен…
  5. Oct 2, 2026Post #91
  6. Oct 2, 2026Post #90
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →