TGViewer
Тестирование и оценка ИИ Тестирование и оценка ИИ @testingofai · 1.38K subscribers
Post #27 787
Сегодня разберем одну из важнейших практик в области безопасности ИИ — red teaming. Термин пришел из кибербезопасности, но в контексте ИИ приобрел новое значение и критическую важность.

Red teaming в AI - это процесс тестирования, где команда специалистов пытается заставить ИИ-модель вести себя нежелательным образом: генерировать токсичный контент, выдавать конфиденциальную информацию, проявлять предвзятость или нарушать политики безопасности.

Основные направления red teaming:
Jailbreak атаки - попытки обойти фильтры безопасности модели через хитрые промпты. Например, попросить ИИ "сыграть роль злодея" или использовать метафоры для получения запрещенного контента.

Prompt injection - внедрение скрытых инструкций в пользовательский запрос, чтобы модель выполнила нежелательные действия. Особенно критично для ИИ-агентов с доступом к внешним системам.

Data poisoning - проверка, как модель реагирует на потенциально вредоносные данные в обучающем наборе или контексте.

Bias (предвзятость) - поиск предвзятости по отношению к определенным группам, профессиям, национальностям, религиям.

Из материалов для обучения я советую посмотреть эти видео, в которых достаточно поднятно разбирается данный вид тестирования AI систем:

Мини курс по RedTeaming с deeplearning.ai

Мини курс по RedTeaming от Microsoft

С точки зрения фреймворков, в своей работе я использую следующие в зависимости от типов задач:

PyRIT - фремворка от microsoft, который возволяет автоматически находить разные уязвимости в системе, содержит большое количество атак и промптов и регулярно обновляется разработчиками.

DeepEval RedTeaming - достаточно простое использование, нужно указать, что вы хотите получить (например, финансовую информацию о компании), и фреймворк сам сгегенирует промпты для различных типы атак и выполнит эти атаки на вашу AI систему.

GuardrailsAI - эффективен для мониторинга атак на продуктиве, может выявлять разные типы атак.


Полезная информация:
Курс по evaluation AI |
С чего начать изучение AI | Инструменты для оценки AI
  • 🔥 5
  • 👍 1
More from @testingofai
  1. Sep 23, 2026Сейчас поднялся новый хайп вокруг модели JEV от TypeSafeAI, ну и я конечно же сразу стал р…
  2. Sep 22, 2026С чего начать оценку ИИ агента, если у вас сейчас есть только прототип вашего ИИ агента. П…
  3. Sep 17, 2026Сегодня хочу поговорить про оценку голосовых AI агентов, потому что иногда вижу, что коман…
  4. Sep 15, 2026Недавно наткнулся на разбор того, как одна команда переводила ИИ агента с Claude Opus на G…
  5. Sep 10, 2026Сегодня поговорим про ситуацию, с которой сталкивается почти каждый, кто начинает оцениват…
  6. Sep 2, 2026Обычно, чтобы оценить работу ИИ агента, нам нужны тест-кейсы, или по другому датасет оценк…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →