🦾 Инструмент недели: Garak
Generative AI Red-teaming & Assessment Kit — фреймворк для поиска уязвимостей в больших языковых моделях и чат-системах.
➕ По сути, это «сканер» для LLM, который позволяет проверить, как легко модель поддаётся:
— prompt injection и jailbreak-атакам;
— утечке данных из контекста;
— генерации токсичного или вводящего в заблуждение контента;
— воспроизведению тренировочных данных.
Как устроен:
🅰️ Probes — набор сценариев атак (вопросы-ловушки, трюки с кодировкой, обход ограничений).
🅰️ Detectors — модули, которые анализируют ответы и фиксируют сбои.
🅰️ Reports — логи и сводка, показывающая, где модель “сломалась”.
⚡️ Фишка Garak — модульность. Можно проверять OpenAI, Hugging Face, локальные модели или API-сервисы. Подходит для ред-тиминга, security-оценок и проверки кастомных LLM.
📎 GitHub
🐸 Библиотека хакера
#tool_of_the_week
Post #4682
1.17K
- 👍 3
- 🔥 1