Нашел вот такую классную гифку, показывающую как работают гардрейлы.
Для тех кто не знаком, гардрейлы (guardrails) - это по сути система безопасности вокруг модели. Они не улучшают ИИ рещение, не повышают точность самой LLM, но контролируют входы и выходы, чтобы ИИ решение не сказало что-то вредное, неправильное или небезопасное.
Гардрейлы могуть быть как на входе, таки на выходе в ИИ решение.
На входе гардрейлы проверяют, что пользователь не спрашивает что-то незаконное, токсичное или опасное. Если запрос проблемный, он блокируется или переписывается.
На выходе фильтруется сам ответ от ИИ решения и проверяется, нет ли фактической ошибки, риска, токсичности, утечек данных или предвзятости.
Почему это важно знать? По сути гардрейлы это часть процесса обеспечения качества ИИ системы и позволяют обезопасить ИИ решения от различных ситуаций, которые могут влиять на безопасность или качество работы ИИ системы.
Полезная информация:
Курс по evaluation AI |
Мой фреймворк для оценки AI |
С чего начать изучение AI | Инструменты для оценки AI |
Инструменты для оценки AI (ч.2)
Post #69
743
- 👍 5
- 🔥 1