Тут короче знакомые попросили рассказать про их опенсорсный проектик.
Чтобы строить успешный продукт с LLM нужно уметь вовремя говорить “i dont want to talk about it” - для этого используются гардрейлы, и вот, ребята из whitecircle.ai cделали первый полноценный бенчмарк для таких моделей. В своем бенче они сравнивают качество защиты на 17 категориях контента, в том числе смотрят чтобы модели не отклоняли безопасные вопросы, но при этом не были подверженны jailbreak_ам.
👉 Подробнее тут и в твиттере
Post #1751
6.97K