🖍 Ротация и мониторинг API-ключей — алерты на аномальный расход токенов.
Большинство компаний это не настраивают, потому что OpenAI и Anthropic дают базовую статистику в дашборде, но не алертинг.
Нужно либо строить его самостоятельно через billing API, либо использовать сторонние инструменты (Helicone, LangSmith, собственный прокси-слой)
🖍 Rate limiting плюс поведенческие паттерны использования.
Система учится, как конкретный пользователь или приложение обычно взаимодействует с моделью: длина промптов, тематика, частота, время суток. Отклонение от baseline — триггер для алерта или автоматической блокировки. Пример: корпоративный Copilot используется для написания кода. Внезапно через тот же ключ начинают идти запросы про сетевые уязвимости и эксплойты — это аномалия, даже если rate limit не превышен. Классические WAF и IDS это не поймают, потому что запросы валидные с точки зрения протокола.
🖍 Изоляция self-hosted моделей — никаких открытых портов, обязательная аутентификация.
Ollama по умолчанию слушает только
127.0.0.1 — но стоит пользователю выставить OLLAMA_HOST=0.0.0.0, эндпойнт открывается в сеть без какой-либо аутентификации. 175 000 открытых хостов по данным SentinelLABS и Censys. Ставить firewall, VPN или reverse proxy с аутентификацией перед эндпойнтом модели.
🖍 Sandboxing агентов — ограничение доступа к инструментам и внешним данным.
Минимальные права, изоляция в контейнере, запрет исходящих соединений к произвольным адресам, логирование всех действий агента — и делать это должен не тот же самый агент!
Золотые времена настают для инноваций.
@gostev_future