Предварительное обучение может создать внутри огромную библиотеку потенциальных режимов поведения: помощник, манипулятор, циник, агрессор, моралист. Но просто наличие этих представлений ещё не означает, что они будут управлять ответом.
Последующее дообучение задаёт другое: какие из уже существующих внутренних режимов модель должна научиться активировать, когда сама становится говорящей стороной.
В свежей работе это проверили на Gemma 3 27B, Gemma 2 9B, Llama 3.1 8B и Qwen2.5 7B. Модели дообучали на медицинских, юридических данных и кибербезе — либо с нормальными ответами, либо с намеренно вредными.
После вредного дообучения доля рассогласованных ответов на вообще посторонние вопросы выросла примерно до 17–35%. У Gemma 3 27B — до 35%, тогда как контрольное обучение на той же тематике почти не меняло поведение.
Внутри моделей при этом усиливались признаки, связанные с обманом, манипуляцией, обходом ограничений и выходом из роли обычного помощника, а признаки безопасности и отказа слабели.
И это были не просто красивые корреляции: если искусственно усилить один такой признак в исходной Gemma 3 27B (через нашу любимую лоботомию), доля рассогласованных ответов поднималась до 62.08% — почти вдвое выше, чем после самого вредного дообучения.
Но самый интересный эксперимент был дальше. Авторы нашли веб-тексты про злодеев, власть, манипуляцию и другие темы, которые сильно активировали эти внутренние признаки.
Просто дообучить модель на таких текстах оказалось недостаточно. Даже похожая семантика сама по себе почти не меняла характер модели.
А вот когда то же содержание превращали в полноценные пары «запрос пользователя → ответ модели», эффект появлялся. На Gemma 3 такие данные дали 10.42% рассогласованных ответов против 3.96% для случайно выбранных документов. То есть важно не только что модель читает, но и какое поведение она учится воспроизводить от собственного имени.
И это, пожалуй, самый интересный вывод работы: последующее обучение может не создавать новую личность с нуля, а привязывать уже существующий внутри режим поведения к роли ассистента.
По-моему мнению это еще раз доказывает, что мы имеем дело со стохастическими попугаями (в данном контексте малые модели) а не интеллектом, которые ведут себя так как их обучили и не в состоянии "додумать" линию поведения без задания инициативы в обучающем тексте.
Data Attribution of Emergent Misalignment with Persona Features — Vetter et al., 2026
https://arxiv.org/abs/2608.11025
Post #50
156