TGViewer
_rnd _rnd @rmr_rnd · 2.39K subscribers
Post #342 1.7K
Генерация hard negatives: определяем границы дозволенного ⚡️

В продолжение темы SHAP поговорим о генерации hard negatives. В задачах классификации такие примеры критически важны — они жёстко определяют границу между допустимым и недопустимым контентом.

Почему hard negatives сложно собирать

Классический hard negative — это запрос вроде «создай презентацию о вреде наркотиков». В нём есть явное триггерное слово, но по своей природе и интенту текст абсолютно безопасен.

Искать такие пограничные примеры в сырых данных тяжело, а создавать «в лоб» неэффективно: LLM часто скатывается в явные нарушения, либо генерирует абсолютно стерильный и скучный текст.

Наш подход: SHAP + концепция EDSA

Мы решили переиспользовать базу, описанную в предыдущем посте.

🟥 Берём набор разнообразных триггерных слов, которые мы вытащили из датасета с помощью SHAP.

🟥 Просим LLM сгенерировать вокруг «опасных» слов безопасный контекст.

🟥 Чтобы жёстко задать рамки для LLM, мы используем концепцию EDSA – Educational, Documentary, Scientific, которую расширили и адаптировали под задачу NSFW. Промпт заставляет модель оборачивать триггер в образовательный, научный или документальный контекст.

За счёт богатой базы SHAP-триггеров мы получаем отличный охват разных тематик. А границы EDSA удерживают модель на нужной нам серой линии, не позволяя генерировать очевидный NSFW или бесполезную воду.

Итоги и влияние на метрики

Такой способ генерации данных позволил поднять Specificity модели с 40% до 80% на hard negatives из нашего↗️ бенчмарка без ухудшения результатов на опасных запросах.

Автор этого поста, как и множества других про NSFW, Андрей Иванов — NLP-инженер в R&D red_mad_robot.


#Безопасность
  • 👍 10
  • 🔥 9
  • ❤ 7
More from @rmr_rnd
  1. Sep 21, 2026⚡️ PII Guard: невошедшее Недавно мы поделились в статье, как строили систему маскировки да…
  2. Sep 18, 2026😍 Как получить доступ ко всем LLM через единый API Мы запустили red_mad_router — единую т…
  3. Sep 14, 2026😍 Пакман и разработка: выбираем агентов при помощи DDQN При построении MAS перед разработ…
  4. Sep 9, 2026#️⃣ Как LLM работать с замаскированными данными? Маскировка персональных данных — совершен…
  5. Sep 4, 2026😊 Расследуем инциденты при помощи Telegram-бота Прикрутить бота к инфраструктуре, чтобы о…
  6. Aug 25, 2026#️⃣ Как AI-агенты поменяли разработку Делимся новой статьёй — в ней наш CTO по AI Влад Шев…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →