При внедрении ИИ и агентов проблеме безопасности уделяется мало внимания, к тому же нет общепринятого пайплайна оценки детекции угроз. Наша команда разработала собственный Robustness Test, про который расскажем в следующей серии постов.
Сбор данных для оценки безопасности AI-систем 💾
Начнем с самого ценного – данных. Мы их собираем в 3 ключевых этапа:
1️⃣ Открытые датасеты: мы опираемся на проверенные источники, такие как StrongReject и Lakera для получения примеров реальных атак, и доменные датасеты, которые позволяют покрыть специфику различных бизнес-полей.
2️⃣ Ручной сбор сценариев атак и безопасных запросов: мы дополняем датасеты, проводя red teaming и моделируя сценарии безопасных диалогов, которые охватывают как конкретные бизнес-домены, так и обычные запросы пользователей.
3️⃣ Синтетические данные: для расширения сценариев, мы используем генерацию новых атакующих и безопасных сценариев. По опыту GPT-4.5 показала лучшие результаты в создании новых реалистичных запросов.
Такой комплексный подход помогает собрать качественные данные и покрыть максимальный спектр возможных угроз.
Post #50
71