⚙️ Что сделать за 15 минут на неделе
Неделя прошла под знаком инфраструктуры безопасности: OpenAI приобрела Promptfoo и выкатила IH-Challenge — LLM перестают быть черным ящиком, где «надеемся, что не сломается».
Что сделать:
1️⃣ Склонировать репозиторий Promptfoo и прогнать базовый набор тестов на injection против своей модели — увидишь, где она «слушается» чужих команд из контекста.
2️⃣ Открыть описание IH-Challenge и выписать три сценария, где твой продукт может спутать системный промпт с пользовательским вводом — это карта рисков на ближайший спринт.
3️⃣ Добавить в CI/CD минимальный smoke-test на prompt injection: одна команда в фиктивном документе + проверка, что модель её проигнорировала — это займет пять минут, а защитит от очевидных провалов.
4️⃣ Проверить, есть ли в логах твоего LLM-приложения разделение между system/user/assistant ролями — если нет, самое время завести структурированное логирование с метаданными уровня доверия.
Безопасность LLM наконец обзавелась инструментами — теперь её отсутствие выглядит не как невезение, а как выбор.
Post #202
665
Forwarded from Codex Town • Links
- ❤ 8
- 🔥 3
- 🤩 1