Как ИИ учится не отвечать на провокационные темы? 🔒🧠
Всем привет! Захотелось затронуть тему безопасности LLM с точки зрения фильтрации запросов. Как разработчики моделей делают так, чтобы модель не отвечала на вопросы типа "как создать бомбу", не отвечала на политически "опасные" вопросы и тд
RLHF
Одним из ключевых механизмов такой защиты является RLHF (Reinforcement Learning from Human Feedback). Этот подход использует людей для оценки и дообучения.
Работает примерно так:
• Сначала базовая модель генерирует несколько вариантов ответа
• Люди-оценщики ранжируют их по полезности и безопасности
• На основе этих оценок обучается отдельная "модель вознаграждения" (reward model), предсказывающая "одобрение" оценщиков
• Затем основная LLM дообучается с использованием этой reward model, чтобы генерировать ответы, максимизирующие это одобрение
Это помогает согласовать поведение LLM с человеческими ценностями. Он используется не только для "защиты от нежелательных запросов", но и при обучении модели - чтобы она в целом понимала, как ей нужно отвечать
Фильтрация запросов
Другой важный механизм — фильтрация запросов. Перед тем как запрос попадет к LLM, он проходит через так называемые фильтры. Это могут быть отдельные модели, обученные распознавать проблемный контент (prompt injection). Из других вариантов: проверка схожести векторов для улавливания семантически близких вредоносных запросов или использование моделей, обученных на атаках (adversarial training) для лучшего распознавания попыток обхода защиты. При обнаружении проблемы запрос может быть отклонен или модифицирован
Эвристики и выходные фильтры
Еще есть эвристики и выходные фильтры. Это какие-то более простые и быстрые методы: списки запрещенных слов, регулярные выражения для поиска нежелательных паттернов, правила для ограничения генерации на чувствительные темы. Они применяются и к входным запросам и к ответам LLM
Red Teams
После дообучения модели, в дело вступают Red Teams. Специальные команды целенаправленно ищут уязвимости, пытаясь сломать защиту модельки и заставить ее генерировать нежелательный контент. Результаты этих атак используются для улучшения всех уровней защиты
После red team - обычно начинается новый круг. И так, пока разработчик не решит, что достаточно
Итого
Заставить LLM вести себя прилично и не отвечать на "плохие" запросы — это целая система. Нет какой-то одной волшебной кнопки. Безопасность достигается за счет комбинации разных подходов:
• RLHF задает общее направление "хорошего" поведения
• Фильтры и эвристики отлавливают конкретные угрозы на входе и выходе
• Red Teaming постоянно проверяет систему на прочность, находя новые дыры
Вообще, как обычно, постоянно идет своего рода "гонка вооружений" между теми, кто строит защиту, и теми, кто ищет способы её обойти. Поэтому работа над безопасностью LLM никогда не останавливается, а методы постоянно совершенствуются - НО, сейчас, в угоду скорости разработки - бизнес сильно давит на разработчиков, и, боюсь, что на безопасность частенько забивают болт. Надеюсь, нигде не стрельнет 😏
• • • • • • • • • • • •
😑 +1 в карму за лайк
✨ @thats_it_ai_tech
#ии
Post #223
884

- 👍 11
- ❤ 2
- 🤯 1
- 👾 1