Mistral выпустила открытый фильтр безопасности для текста и изображений
Shieldstral весит 3 млрд параметров, распространяется под Apache 2.0 и, по данным Mistral, помещается на одной NVIDIA-карте с 16 ГБ памяти.
Самая интересная часть: правила модерации передаются модели обычным текстом во время запроса. Можно описать собственную политику продукта, а Shieldstral вернёт калиброванную оценку yes/no. Переобучать классификатор под каждое новое правило не требуется.
Модель проверяет промпты, ответы и их пары; понимает текст, изображения и смешанный ввод. Это выглядит полезнее жёстко прошитых категорий для команд, которым нужны разные правила для детского приложения, корпоративного ассистента или генератора изображений.
Mistral утверждает, что модель конкурирует с открытыми guard-моделями, которые до семи раз крупнее. Но есть честная оговорка: мультиязычность и работа с очень длинными документами пока остаются направлениями развития.
Модель, веса и результаты тестов Shieldstral
#mistral #opensource #llm #aisafety #machinelearning
Post #636
46

- ❤ 5
- 👍 2
- 🔥 2