Обычные модели-фильтры носят в себе фиксированную таксономию: список запрещённых категорий зашит на обучении, под свои правила её приходится дообучать. Здесь политика пишется словами в момент запроса. В
<Instruct> идёт контекст проверки и строгость, в <Query> один вопрос с ответом да или нет («Этот контент призывает к насилию?»), в <Document> то, что проверяем: запрос пользователя, ответ модели, пару из них или картинку с текстом.Модель за один проход смотрит только на логиты
yes и no и нормализует их софтмаксом в оценку безопасности. На выходе получается число, по которому ставят свой порог и сортируют по уверенности. Одной формулировкой закрываются классификация запросов, модерация ответов, детекция отказов, токсичность и картинки. По замерам Mistral на текстовой безопасности, детекции отказов, переносе на новые политики и мультимодальных тестах Shieldstral держится вровень с открытыми моделями-фильтрами в 7 раз крупнее.Веса лежат на Hugging Face, про устройство и обучение рассказали в анонсе и техотчёте.
@neuro_channel
