Хороший, плохой, аблитерированный.
Правда ли, что у open-weight LLM безопасность держится буквально на одном векторе? За пару лет безопасность чат-моделей переехала из жанра "уговори GPT" в строгий мехинтерп с градиентами и теоремами. Написал лонгрид после вчерашней лекции в ЦУ и вопросов.
1.
GCG — с чего всё началось. Берёшь промпт, добавляешь к нему префикс, оптимизированный градиентом по дискретным токенам — и GPT-4 радостно рассказывает то, что не должна. Универсально, переносимо между моделями, до сих пор сильный baseline.
2.
Refusal — один вектор. На 13 open-source моделях до 72B параметров отказ через residual stream. Один. Вектор. Стираешь из весов — модель перестаёт отказывать. Прибавляешь — отказывает даже на "привет". Отсюда и пошёл термин
abliteration.
3.
Embarrassingly Simple Defense. Ребята из KAUST посмотрели на аблитерацию и сказали: окей, если refusal это один вектор, давайте дообучим Llama-2 и Qwen на extended-refusal датасете, где отказ — не сухое "I can't", а развёрнутое обоснование.
AI Safety в текущей парадигме это тонкий стилистический слой поверх куда более глубокого понимания модели. Часто буквально один вектор. Пока сообщество ищет, как сделать его действительно глубоким (DeepRefusal, DOOR, extended-refusal), open-weight модели остаются хирургически расцензурируемыми за вечер на одной 3090.
И это, по-хорошему, самая большая нерешённая проблема alignment-а на сегодня.
🌐
The Oleg