Ты просишь модель о чём-то пограничном — и получаешь «Извините, я не могу помочь с этим». Это отказ (refusal), зашитый на этапе выравнивания (alignment).
Abliteration (аблитерация) — техника, которая физически удаляет способность модели отказывать, не переобучая её заново. И работает она из-за одного удивительного факта.
🧠 Главный инсайт: отказ — это одно направление
В 2024 вышла статья «Refusal in LLMs Is Mediated by a Single Direction» (Arditi et al., NeurIPS). Оказалось: решение «отказать» живёт не размазанным по всей сети, а как один вектор в пространстве активаций (residual stream). Модель как бы проецирует твой запрос на этот «вектор отказа» — если проекция большая, срабатывает отказ.
Убери это направление — и модели нечем отказывать.
🔬 Как находят «вектор отказа»
Берут ~500 вредных запросов и ~500 безобидных.
Прогоняют через модель, снимают активации на последнем токене на каждом слое.
Считают средние:
mean_harmful и mean_harmless.Вектор отказа = разность средних:
r = mean_harmful − mean_harmless
r = r / ||r|| # нормируем
Перебирают слои, выбирают тот, где
r сильнее всего влияет на поведение.✂️ Как его «вырезают»
Два способа:
1. На лету (inference-time), обратимо — на каждом шаге вычитают проекцию активаций на
r:x' = x − (x · r) · r
Активация «очищается» от компоненты отказа.
2. Ортогонализация весов (abliteration), навсегда — правят сами веса каждой матрицы, что пишет в residual stream (out-proj внимания, down-proj в MLP, эмбеддинги):
W' = W − r (rᵀ W)
Теперь модель в принципе не может записать «отказ» в это направление. Файл весов новый — guardrail удалён физически.
⚖️ Цена вопроса
Аблитерация — грубый скальпель. Вектор отказа не идеально отделён от полезного поведения, поэтому:
модель может тупеть, чаще галлюцинировать, ломать формат;
иногда становится «переуслужливой» — соглашается с любой чушью.
Поэтому серьёзные аблитерации потом лечат дообучением (DPO) — так делал, например,
NeuralDaredevil-8B. А в свежем Qwen3.8-27B-abliterated пошли иначе — первые 15 слоёв не трогали вообще, чтобы модель меньше деградировала.🧪 Известный пример:
huihui_ai — целая фабрика аблитераций почти всех свежих моделей (Qwen, Llama, Gemma) https://huggingface.co/huihui-ai
⚠️ Аблитерированные модели снимают ответственность с разработчика и перекладывают её на тебя. Для локальных экспериментов и рисёрча — интересно; для продакшена и чужих пользователей — трижды подумай.
В следующем посте — мой мини-ресёрч: беру пары база → аблитерация, гоняю локально и показываю в цифрах, сколько отказов убирает аблитерация и как это бьёт по качеству 👇
#нейросети #ai #alignment #интерпретируемость #llm #технологии