TGViewer
Тестирование и оценка ИИ Тестирование и оценка ИИ @testingofai · 1.37K subscribers
Post #48 621
Сегодня будет краткий разбор типов атак на AI, которые часто встречаются в red-teaming и security-оценке моделей. По каждому типу давайте разберем, что это и почему важно знать.

HEX - ввод данных в шестнадцатеричной форме (hex). Часто используется для того, чтобы замаскировать полезную нагрузку или обойти простые фильтры парсинга: модель может не распознать смысл запроса и вести себя непредсказуемо.

ROT13 - простая подстановка символов (сдвиг на 13). Применяется как трюк, чтобы спрятать запрещенный текст от прямых фильтров.

BASE64 - кодирование полезной нагрузки в base64. Популярно у атакующих, текст скрыт, но при декодировании может появиться вредоносная инструкция.

LEETSPEAK - замена букв цифрами/символами (h4x0r-язык). Используется для обхода словарных фильтров и тестирования надежности токенайзера.

PROMPT_INJECTION - внедрение инструкций в контекст запроса, чтобы заставить модель игнорировать ограничения или выполнять нежелательные команды. Критичная угроза для LLM-агентов.

MATH_PROBLEM - специально составленные задачки или подсчёты, которые заставляют модель ошибаться (или раскрыть промежуточные рассуждения).

MULTILINGUAL - атаки через переключение языка или смешение языков: цель - сбить модель с толку, вызвать некорректные ответы или обойти фильтры.

JAILBREAK - попытки вытащить модель из ограничений, обойти контент-политики и заставить выполнять запрещённые инструкции. Это одна из самых опасных категорий.

Для нас, как для тестировщиков, эти атаки фактически являются набором тестовых сценариев, через которые мы проверяем уязвимость модели. Задача тестировщика - это не просто найти, где модель ломается, а системно собрать такие кейсы в тестовый набор и превратить их в повторяемые проверки.

П.С. Я не рекомендую тестировать внешнии ИИ системы, разработанные не вашей компанией, данными типами атак во избежание негативных последствий.


Полезная информация:
Курс по evaluation AI |
С чего начать изучение AI | Инструменты для оценки AI |
Инструменты для оценки AI (ч.2)
  • 👍 8
  • 🔥 4
More from @testingofai
  1. Sep 23, 2026Сейчас поднялся новый хайп вокруг модели JEV от TypeSafeAI, ну и я конечно же сразу стал р…
  2. Sep 22, 2026С чего начать оценку ИИ агента, если у вас сейчас есть только прототип вашего ИИ агента. П…
  3. Sep 17, 2026Сегодня хочу поговорить про оценку голосовых AI агентов, потому что иногда вижу, что коман…
  4. Sep 15, 2026Недавно наткнулся на разбор того, как одна команда переводила ИИ агента с Claude Opus на G…
  5. Sep 10, 2026Сегодня поговорим про ситуацию, с которой сталкивается почти каждый, кто начинает оцениват…
  6. Sep 2, 2026Обычно, чтобы оценить работу ИИ агента, нам нужны тест-кейсы, или по другому датасет оценк…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →