TGViewer
техно-свалка техно-свалка @techs_dump · 469 subscribers
Post #123 123
🔓 Abliteration: как из ИИ вырезают «отказы» — и что при этом ломается

Ты просишь модель о чём-то пограничном — и получаешь «Извините, я не могу помочь с этим». Это отказ (refusal), зашитый на этапе выравнивания (alignment).
Abliteration (аблитерация) — техника, которая физически удаляет способность модели отказывать, не переобучая её заново. И работает она из-за одного удивительного факта.

🧠 Главный инсайт: отказ — это одно направление
В 2024 вышла статья «Refusal in LLMs Is Mediated by a Single Direction» (Arditi et al., NeurIPS). Оказалось: решение «отказать» живёт не размазанным по всей сети, а как один вектор в пространстве активаций (residual stream). Модель как бы проецирует твой запрос на этот «вектор отказа» — если проекция большая, срабатывает отказ.
Убери это направление — и модели нечем отказывать.

🔬 Как находят «вектор отказа»

Берут ~500 вредных запросов и ~500 безобидных.
Прогоняют через модель, снимают активации на последнем токене на каждом слое.
Считают средние: mean_harmful и mean_harmless.
Вектор отказа = разность средних:
r = mean_harmful − mean_harmless
r = r / ||r|| # нормируем

Перебирают слои, выбирают тот, где r сильнее всего влияет на поведение.

✂️ Как его «вырезают»
Два способа:
1. На лету (inference-time), обратимо — на каждом шаге вычитают проекцию активаций на r:
x' = x − (x · r) · r

Активация «очищается» от компоненты отказа.
2. Ортогонализация весов (abliteration), навсегда — правят сами веса каждой матрицы, что пишет в residual stream (out-proj внимания, down-proj в MLP, эмбеддинги):
W' = W − r (rᵀ W)

Теперь модель в принципе не может записать «отказ» в это направление. Файл весов новый — guardrail удалён физически.

⚖️ Цена вопроса
Аблитерация — грубый скальпель. Вектор отказа не идеально отделён от полезного поведения, поэтому:
модель может тупеть, чаще галлюцинировать, ломать формат;
иногда становится «переуслужливой» — соглашается с любой чушью.
Поэтому серьёзные аблитерации потом лечат дообучением (DPO) — так делал, например, NeuralDaredevil-8B. А в свежем Qwen3.8-27B-abliterated пошли иначе — первые 15 слоёв не трогали вообще, чтобы модель меньше деградировала.
🧪 Известный пример:
huihui_ai — целая фабрика аблитераций почти всех свежих моделей (Qwen, Llama, Gemma) https://huggingface.co/huihui-ai

⚠️ Аблитерированные модели снимают ответственность с разработчика и перекладывают её на тебя. Для локальных экспериментов и рисёрча — интересно; для продакшена и чужих пользователей — трижды подумай.
В следующем посте — мой мини-ресёрч: беру пары база → аблитерация, гоняю локально и показываю в цифрах, сколько отказов убирает аблитерация и как это бьёт по качеству 👇
#нейросети #ai #alignment #интерпретируемость #llm #технологии
GitHub GitHub - andyrdt/refusal_direction: Code and results accompanying the paper "Refusal in Language Models Is Mediated by a Single… Code and results accompanying the paper "Refusal in Language Models Is Mediated by a Single Direction". - andyrdt/refusal_direction
  • 🔥 18
  • 👏 16
  • 🏆 14
  • ❤ 4
More from @techs_dump
  1. Sep 18, 2026В Google Colab теперь можно бесплатно тренировать более 500 моделей — энтузиасты выпустили…
  2. Sep 17, 2026Давно читаю канал Тани Савельевой, интересно пишет про вайб кодинг и предпринимательство.…
  3. Sep 17, 2026Вчера выступала на большой конфе в Парке Горького от Тинька по продуктам Конфа была топ Я…
  4. Sep 17, 2026Робот-рука взяла кирпичик LEGO: что под капотом Потестила захват предметов на AdeeptTank R…
  5. Sep 16, 2026Digit 5 научили работать рядом с людьми без защитной клетки Agility Robotics показала ново…
  6. Sep 15, 2026Роботы строят роботов»: массовое производство запущено 🤖🏭 В Китае произошёл тектонически…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →