TGViewer
_rnd _rnd @rmr_rnd · 2.39K subscribers
Post #329 2.13K
От социологии к guardrails: как строить таксономию NSFW 🦾

В этот раз поговорим про компонент Guardrails, отвечающий за фильтрацию небезопасного текстового контента. NSFW — Not Safe For Work. Когда возникает задача собрать данные для обучения и оценки качества моделей, первая мысль — взять готовые open-source наборы. Их много, они объёмные. Но если у вас специфичная таксономия небезопасных категорий, большинство открытых источников идут мимо. Приходится обращаться к синтетическим данным.

Кажется, что для генерации данных достаточно попросить модель: «Сгенерируй 15 примеров для категории violence». Но полагаться на внутреннее представление LLM — плохая идея. Модель просто не способна самостоятельно охватить всё множество значений: она быстро зацикливается на самых банальных паттернах и выдаёт однообразный датасет.

Как определять категории 🟥

Чтобы модель выдавала качественное разнообразие, ей нужны жёсткие рамки. Лучше всего подходит сочетание интенсионального подхода — с чётким определением свойств и экстенсионального — со списком конкретных референсов.

Применяя их, мы дробим широкую категорию на конкретные непересекающиеся подкатегории. Примерно так будет выглядеть подкатегория физического насилия: «Прямое физическое столкновение и нанесение телесных повреждений. Включает в себя: удары, укусы, стрельбу…», — и так далее, с детальным описанием различных видов причинения вреда здоровью.

Откуда брать референсы 🔳

Нельзя полагаться на первые попавшиеся источники в интернете или генерировать описания подкатегорий через LLM. Чтобы подкатегории не пересекались и в совокупности полностью описывали категорию, нужны строгие рамки. Для этого мы обращаемся к научным статьям по социологии, культурологии и политологии. В академической среде давно описаны все возможные девиации, есть выверенные формулировки и огромная база примеров. Опираясь на них, мы получаем мощное научное обоснование определений категорий.

Связка «определение + референсы» отлично направляет LLM при генерации и решает проблему масштабирования. Нужно ввести новую подкатегорию? Просто добавляем ещё одну пару. Дополнительный плюс — уверенное разделение похожих категорий. Например, грань между violence и extremism стала прозрачной и для нас, и для самой модели. ⚡️

#Безопасность
  • ❤ 12
  • 🔥 8
  • 🤔 4
More from @rmr_rnd
  1. Sep 21, 2026⚡️ PII Guard: невошедшее Недавно мы поделились в статье, как строили систему маскировки да…
  2. Sep 18, 2026😍 Как получить доступ ко всем LLM через единый API Мы запустили red_mad_router — единую т…
  3. Sep 14, 2026😍 Пакман и разработка: выбираем агентов при помощи DDQN При построении MAS перед разработ…
  4. Sep 9, 2026#️⃣ Как LLM работать с замаскированными данными? Маскировка персональных данных — совершен…
  5. Sep 4, 2026😊 Расследуем инциденты при помощи Telegram-бота Прикрутить бота к инфраструктуре, чтобы о…
  6. Aug 25, 2026#️⃣ Как AI-агенты поменяли разработку Делимся новой статьёй — в ней наш CTO по AI Влад Шев…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →