TGViewer
That's IT | Сергей Фролов That's IT | Сергей Фролов @thats_it_ai_tech · 2.22K subscribers
Post #223 884
Как ИИ учится не отвечать на провокационные темы? 🔒🧠

Всем привет! Захотелось затронуть тему безопасности LLM с точки зрения фильтрации запросов. Как разработчики моделей делают так, чтобы модель не отвечала на вопросы типа "как создать бомбу", не отвечала на политически "опасные" вопросы и тд

RLHF

Одним из ключевых механизмов такой защиты является RLHF (Reinforcement Learning from Human Feedback). Этот подход использует людей для оценки и дообучения.

Работает примерно так:
• Сначала базовая модель генерирует несколько вариантов ответа
• Люди-оценщики ранжируют их по полезности и безопасности
• На основе этих оценок обучается отдельная "модель вознаграждения" (reward model), предсказывающая "одобрение" оценщиков
• Затем основная LLM дообучается с использованием этой reward model, чтобы генерировать ответы, максимизирующие это одобрение

Это помогает согласовать поведение LLM с человеческими ценностями. Он используется не только для "защиты от нежелательных запросов", но и при обучении модели - чтобы она в целом понимала, как ей нужно отвечать

Фильтрация запросов

Другой важный механизм — фильтрация запросов. Перед тем как запрос попадет к LLM, он проходит через так называемые фильтры. Это могут быть отдельные модели, обученные распознавать проблемный контент (prompt injection). Из других вариантов: проверка схожести векторов для улавливания семантически близких вредоносных запросов или использование моделей, обученных на атаках (adversarial training) для лучшего распознавания попыток обхода защиты. При обнаружении проблемы запрос может быть отклонен или модифицирован

Эвристики и выходные фильтры

Еще есть эвристики и выходные фильтры. Это какие-то более простые и быстрые методы: списки запрещенных слов, регулярные выражения для поиска нежелательных паттернов, правила для ограничения генерации на чувствительные темы. Они применяются и к входным запросам и к ответам LLM

Red Teams

После дообучения модели, в дело вступают Red Teams. Специальные команды целенаправленно ищут уязвимости, пытаясь сломать защиту модельки и заставить ее генерировать нежелательный контент. Результаты этих атак используются для улучшения всех уровней защиты

После red team - обычно начинается новый круг. И так, пока разработчик не решит, что достаточно

Итого

Заставить LLM вести себя прилично и не отвечать на "плохие" запросы — это целая система. Нет какой-то одной волшебной кнопки. Безопасность достигается за счет комбинации разных подходов:
• RLHF задает общее направление "хорошего" поведения
• Фильтры и эвристики отлавливают конкретные угрозы на входе и выходе
• Red Teaming постоянно проверяет систему на прочность, находя новые дыры

Вообще, как обычно, постоянно идет своего рода "гонка вооружений" между теми, кто строит защиту, и теми, кто ищет способы её обойти. Поэтому работа над безопасностью LLM никогда не останавливается, а методы постоянно совершенствуются - НО, сейчас, в угоду скорости разработки - бизнес сильно давит на разработчиков, и, боюсь, что на безопасность частенько забивают болт. Надеюсь, нигде не стрельнет 😏

• • • • • • • • • • • •

😑 +1 в карму за лайк

@thats_it_ai_tech

#ии
  • 👍 11
  • ❤ 2
  • 🤯 1
  • 👾 1
More from @thats_it_ai_tech
  1. Sep 2, 2026я тут понял что хочу уже очки с экраном доп реальности и plaud наушники чтобы общаться с а…
  2. Aug 2, 2026наконец-то, жду пока такая практика будет внедряться повсеместно 😺
  3. Jul 8, 2026попробовал для speech to text вот такую прогу -- офигенно работает, сильно быстрее чем Whi…
  4. Jul 4, 2026Кажется, началось
  5. Jul 2, 2026Всем привет, ребята! Как делишки? Я ожил, скоро надеюсь возобновить здесь что-то)) Уже пот…
  6. Mar 20, 2026Claude Code в Телеграм. Если вчера я писал о том, что Anthropic выкатили свой ответ OpenCl…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →