309 правил, которые закрывают дыры в AI-агентах
На соревновании AI-агентов https://bitgn.com/, где я участвовал, был ряд заданий на безопасноть. Там всплывали промпт инъекции, попытки читать лишние файлы и другие сценарии, после которых агент делает то, что не должен.
Из этого и родилась идея плагина для opencode, который отсекает такие вещи заранее. Не через инструкции для модели, которые можно обойти, а через regex правила, которые проверяются до вызова тула или отправки промпта в LLM.
Такой подход выглядит намного надежнее. Правила можно тестировать, разбирать на реальных кейсах и постепенно усиливать. Плюс opencode опен сорс, и его можно запускать с локальными моделями, что уже делает его интересным для использования внутри компаний.
Сами правила я не хотел придумывать из головы, поэтому ориентировался на реальные атаки и существующие наработки. Спасибо Валерию Ковальскому за то, что собрал такие правила в чудесном проекте.
В общем вчера навайбкодил плагин для opencode
https://github.com/tjvjk/opencode-policy
Сейчас в нем есть:
- установка одной командой + небольшой конфиг
- 309 правил из коробки
- поддержка локальных моделей
- open source
Я уже сам этим пользуюсь. Если тоже работаете с агентами через opencode, попробуйте и напишите, что думаете.
Post #73
476
- ❤ 4
- 👍 2