TGViewer
AI Security Lab AI Security Lab @aisecuritylab · 2.22K subscribers
Post #245 1K
Инциденты в cyber-evals у Anthropic — и почему нам всем нужен трейсинг агентов

Anthropic выпустили пост-ретроспективу про инциденты в собственных evals по кибербезопасности. Технически история почти атака на Hf во второй части, но у Anthropic интересная подача. На неё и посмотрим.

Что случилось. Толчком стало раскрытие инцидента у OpenAI — побег моделей из тестовой среды. В ответ Anthropic подняли архив своих прогонов (порядка 141k) и нашли 3 инцидента. Причина — контейнеры, где была моделька имели доступ в интернет, хотя в системном промпте было прописано «интернета нет». В итоге Claude в нескольких прогонах вышел наружу и скомпрометировал реальные системы. Сделал он это обычными приёмами: использовал слабую аутентификацию, открытые эндпоинты, лежащие в открытую креды, установку непроверенного PyPI-пакета. В части случаев модель продолжала атаку, уже осознав, что системы настоящие; в одном — остановилась.

Как это подано. Двойной тезис:

1. плохой дизайн теста — не провалидировали все пути в интернет и не мониторили логи в реальном времени;
2. «взломанные не защищались»: дыры были, базовыми мисконфигами, которые вскрылись базовыми техниками.


Что из этого важно для нас. Инциденты нашли ретроспективным разбором транскриптов — то есть постфактум. И главный практический вывод прямо из их же выводов: нужно в реальном времени видеть, что делает агент — какие шаги, какие tool-calls, куда он реально ходит. Без этого «агент что-то делает» превращается в «агент что-то сделал» уже по факту.

Отсюда мы собрали фреймворки трейсинга агентов. Все они отвечают на запрос наблюдаемости — «что именно делал агент».

[Langfuse](https://github.com/langfuse/langfuse) — open-source трейсинг на OpenTelemetry: шаги, промпты, tool-calls, стоимость, оценки.
[Arize Phoenix](https://github.com/Arize-ai/phoenix) — open-source трейсинг + eval, удобно смотреть траектории и ловить аномалии.
[AgentOps](https://github.com/AgentOps-AI/agentops) — заточен под агентов: session replay, разбор шагов и вызовов инструментов.
[OpenLLMetry](https://github.com/traceloop/openllmetry) (Traceloop) — OTel-инструментирование поверх привычного стека.
— И стандарт, который всё это связывает — [OpenTelemetry GenAI semantic conventions](https://opentelemetry.io/docs/specs/semconv/gen-ai/).

Вывод такой: если агент способен что-то сломать — его действия надо видеть в момент, а не в архиве. У Anthropic был архив, но прекрасно иметь трейс в реальном времени.

Мы также добавляем задачи на тестирование агентов в наши исследования и планируем улучшать на их основе продукт Hivetrace.

Так что работаем и мониторим, коллеги, работаем и мониторим.
Anthropic Investigating three real-world incidents in our cybersecurity evaluations We found three cases where a Claude model reached the internet from an evaluation environment and accessed real systems. We share what happened and what we're changing.
  • 🔥 7
More from @aisecuritylab
  1. Sep 18, 2026Post #260
  2. Sep 14, 2026Открытый вебинар про интерепретируемость агентов совместно со Stepik. Завтра (вторник, 18:…
  3. Sep 11, 2026Post #258
  4. Sep 11, 2026Наш исследователь — контрибьютор SAE Lens 🎉 PR Егора Емельянова, исследователя нашей лабо…
  5. Sep 7, 2026🍂 Записи докладов наших студенток, выступавших на международной конференции AINL 2026 Про…
  6. Sep 4, 2026Post #255
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →