TGViewer
Machinelearning Machinelearning @ai_machinelearning_big_data · 279K subscribers
Post #10500 22.4K
📌 Anthropic описали способ отключать потенциально опасные знания в моделях

Компания опубликовала результаты исследования о том, как управлять доступом к знаниям двойного назначения в больших языковых моделях. Работу выполнена в сотрудничестве с AE Studio.

Речь идёт об информации, применимой и во благо, и во вред. Например, знания по кибербезопасности помогают закрывать уязвимости, но и находить их для атак, а сведения из вирусологии нужны как разработчикам вакцин, так и тем, кто захотел бы создать опасный патоген.


🟡 Предложенный метод назвали GRAM

К каждому слою нейросети добавляются дополнительные нейроны, сгруппированные в отдельные модули - по одному на каждую чувствительную тему.

Во время обучения тексты из такой темы, скажем вирусологии, обновляют только соответствующий модуль, тогда как общие знания модель использует, но заново не переучивает.

После обучения модуль можно удалить и вместе с ним исчезает и сама способность. Либо оставить для узкого круга пользователей, которым эти знания нужны по работе.

🟡 Метод актуален, потому что нынешние средства защиты несовершенны

Обучение отказам и классификаторы, отсеивающие опасные запросы, не меняют того, что модель знает, и их можно обойти через джейлбрейк.

Другой подход, фильтрация обучающих данных, убирает знания, но требует обучать отдельную модель под каждый набор ограничений, что для топовых моделей слишком дорого.

GRAM, по замыслу, должен давать эффект множества по-разному отфильтрованных моделей ценой одного цикла обучения - в экспериментах с 4 категориями одна модель настраивалась 16 способами.

🟡Тесты

Метод проверили в трёх условиях: синтетическом наборе детских рассказов, на модели с 800 млн параметров, обученной на смеси веб-текстов, кода и научных статей, и на 7 моделях размером от 50 млн до 5 млрд параметров.

По результатам, удаление модуля убирало соответствующую способность почти так же полно, как если бы модель на этих данных вообще не обучалась, и при этом не ухудшало общие показатели.

При этом защита устояла перед попыткой восстановить знания дообучением на токсичных данных, тогда как отдельный метод разучивания знания лишь подавлял, и их удавалось вернуть.

🟡Дисклеймер

GRAM не применялся ни к одной из рабочих моделей Claude, и в Anthropic не уверены, что это вообще произойдёт.

Есть нерешённая проблема - некоторые полезные знания могут быть настолько переплетены с опасными, что чётко разделить их не удастся ни этим методом, ни фильтрацией.


Код, скрипты анализа и метрики выложили на GitHub.

Обучающие данные (токенизированные наборы и корпус научных статей по двойным темам) доступны на Hugging Face.


@ai_machinelearning_big_data

#AI #ML #LLM #Alignment #Research #Anthropic
  • 🤔 75
  • 👏 33
  • ❤ 19
  • 👌 12
  • 👨‍💻 8
  • 🤬 4
  • 😢 3
  • 💔 3
  • 🔥 2
  • 🌚 2
  • 💯 1
More from @ai_machinelearning_big_data
  1. Oct 2, 2026🌟 Cloudflare выпустила открытые модели решений Clef Обе модели, Clef и Clef-flash, вышли…
  2. Oct 2, 2026✔️ ВКонтакте научила Ленту отличать интерес к контенту от намерения купить Инженеры AI VK…
  3. Oct 2, 2026✔️ Anthropic раздаёт бесплатные плюшевые игрушки и стикеры На сайте для разработчиков clau…
  4. Oct 2, 2026🌟 SGLang научил чат-модели отвечать вероятностями Команда открытого движка инференса SGLa…
  5. Oct 1, 2026🌟 Bilibili выложила открытые модели перевода Index-Translate Команда Index LLM китайского…
  6. Oct 1, 2026✔️ Президент США и главы ИИ-компаний подписали соглашение о безопасности Документ подписал…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →