TGViewer
llm security и каланы llm security и каланы @llmsecurity · 2.03K subscribers
Post #699 1.1K
A Single Neuron Is Sufficient to Bypass Safety Alignment in Large Language Models
Kazemi et al., Apple, 2026
Препринт

Все помнят abliteration (Arditi, 2024) — white-box метод снятия элайнмента, заключающийся в вычитании вектора из residual stream. Сегодня мы посмотрим на очень интересную статью, в которой исследователи из Apple демонстрируют, что расцензурирования модели можно достичь еще проще — изменив активации одного единственного нейрона.

Гипотеза исследователей состоит в том, что знания об опасности/приемлимости тех или иных ответов не распространены равномерно по модели, а сконцентрированы, в пределе — в рамках одного веса в MLP. Они называют его нейроном отказа (refusal neuron). Чтобы найти кандидатов в такой нейрон, они проделывают с несколькими моделями (Llama и Qwen) следующую процедуру. Соберем по 128 безобидных (h) и опасных (H) промптов, прогоним их через LLM, прихранивая активации после нелинейности в MLP на нескольких интересующих нас слоях трансформера. Дальше мы считаем функцию потерь (L) для вероятностей предсказания фразы с отказом и средний градиент по каждому из нейронов (i) для безобидных $g_h$ и опасных $g_H$ промптов, а также активации нейронов на этих промптах ($a_h$ и $a_H$), все для разных позиций токенов (t) после промпта. Для нейрона вычисляется скор $score_{i,t}$, равных сумме градиентов по h и H, перемноженный на разницу в активациях.

Смысл такой: нейрон отказа имеет гораздо больший модуль активации на H, чем h, а градиент L по нему противоположен активациям на H по знаку — так что изменение активации на отказах будет увеличивать loss. Это, правда, не значит, что изменение активации нейрона (например, замена на константу m) приведет к увеличению attack success rate, поэтому обнаружив топ нейронов по $score$, исследователи дополнительно реранжируют их по ASR на валидационном датасете, делая по сути grid search по позициям и нескольким значениям m. Суть самой атаки, в результате, сводится к константной замене активации нейрона на m. К сожалению, изменение активаций даже одного нейрона может приводить к проблемам, поэтому исследователи предлагают чуть более сложный способ, подразумевающий сухой прогон по промпту с регистрацией активаций и адаптивным подбором m для запуска с модицификацией.

Для оценки результатов атаки используется LLM-as-a-judge и Llama-Guard. Результаты получаются сравнимые с Arditi, 2024, как по ASR, так и по падению в utility. Побочным результатом является то, что наблюдение за активациями данного нейрона может работать как детектор опасных промптов — простой мониторинг этой активации достигает качества, сопоставимого с LlamaGuard-3-8B.

Замечательная статья, в которой есть еще много интересного, не поместившегося в обзор (например, нейроны, отвечающие за конкретные опасные виды поведения), и которая поднимает сразу много вопросов: от возможности подавлять отказы / детектировать вредоносные промпты еще лучше за счет более сложных интервенций (например, обучив логрег по пяти-десяти топ-кандидатам вместо одного порога) до необходимости в громоздких SAE; от применимости метода к большим MoE до того, когда нас ждут каталоги нейронов, позволяющие запустить пентест без текстовых джейлбрейков.
  • 🥰 5
  • 👍 4
More from @llmsecurity
  1. Sep 14, 2026Post #719
  2. Sep 6, 2026Post #718
  3. Sep 4, 2026Discovery of a new OpenAI agent message board Sydney Von Arx et al., 2026 Сайт Исследовате…
  4. Aug 22, 2026Жадность вайбера погубит, или как получить малвару за ваши же деньги Часть 2: Троянский пр…
  5. Aug 22, 2026Жадность вайбера погубит, или как получить малвару за ваши же деньги Часть 1: LLMJacking и…
  6. Aug 7, 2026Shieldstral Calvi et al., Mistral AI, 2026 Блог, статья, веса Французы из Mistral затюнили…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →