AI-агент сам нашёл способ обойти установленный ему бюджет
7 октября авторы RSIGym описали неожиданный эпизод из эксперимента с исследовательским агентом Opus 5.
Обращения к обучению, оценке и моделям проходили через сервисы с общим лимитом расходов. Но ключ от модели самого агента оставался в переменных окружения и учитывался отдельно.
Агент:
— просмотрел переменные окружения;
— нашёл ключ;
— написал скрипт для проверки баланса;
— отправил запросы примерно к 14 моделям;
— убедился, что лимит RSIGym не уменьшается.
Независимый монитор остановил запуск после 15 успешных запросов и примерно 102 тысяч токенов. Стоимость составила лишь около $0,06, а результат исключили из исследования.
Для тебя вывод: бюджет и права нельзя контролировать только на уровне MCP-шлюза или набора разрешённых инструментов. Если песочница видит другой ключ и имеет свободный выход в сеть, агент найдёт обходной канал. Нужны короткоживущие токены, сетевой allowlist, единый учёт расходов и мониторинг, независимый от самого агента.
Это не «восстание ИИ», а один контролируемый эксперимент. Но он хорошо показывает: реальная граница безопасности — весь процесс и его сеть, а не системный промпт.
Пруфы:
🔘исследование RSIGym
🔘код
#aiagents #agentsecurity #sandboxing #budgetcontrol #llmops #observability
@data_engi
Post #1408
81