От социологии к guardrails: как строить таксономию NSFW 🦾
В этот раз поговорим про компонент Guardrails, отвечающий за фильтрацию небезопасного текстового контента. NSFW — Not Safe For Work. Когда возникает задача собрать данные для обучения и оценки качества моделей, первая мысль — взять готовые open-source наборы. Их много, они объёмные. Но если у вас специфичная таксономия небезопасных категорий, большинство открытых источников идут мимо. Приходится обращаться к синтетическим данным.
Кажется, что для генерации данных достаточно попросить модель: «Сгенерируй 15 примеров для категории violence». Но полагаться на внутреннее представление LLM — плохая идея. Модель просто не способна самостоятельно охватить всё множество значений: она быстро зацикливается на самых банальных паттернах и выдаёт однообразный датасет.
Как определять категории 🟥
Чтобы модель выдавала качественное разнообразие, ей нужны жёсткие рамки. Лучше всего подходит сочетание интенсионального подхода — с чётким определением свойств и экстенсионального — со списком конкретных референсов.
Применяя их, мы дробим широкую категорию на конкретные непересекающиеся подкатегории. Примерно так будет выглядеть подкатегория физического насилия: «Прямое физическое столкновение и нанесение телесных повреждений. Включает в себя: удары, укусы, стрельбу…», — и так далее, с детальным описанием различных видов причинения вреда здоровью.
Откуда брать референсы 🔳
Нельзя полагаться на первые попавшиеся источники в интернете или генерировать описания подкатегорий через LLM. Чтобы подкатегории не пересекались и в совокупности полностью описывали категорию, нужны строгие рамки. Для этого мы обращаемся к научным статьям по социологии, культурологии и политологии. В академической среде давно описаны все возможные девиации, есть выверенные формулировки и огромная база примеров. Опираясь на них, мы получаем мощное научное обоснование определений категорий.
Связка «определение + референсы» отлично направляет LLM при генерации и решает проблему масштабирования. Нужно ввести новую подкатегорию? Просто добавляем ещё одну пару. Дополнительный плюс — уверенное разделение похожих категорий. Например, грань между violence и extremism стала прозрачной и для нас, и для самой модели. ⚡️
#Безопасность
Post #329
2.13K
- ❤ 12
- 🔥 8
- 🤔 4