С выходом AI-агентов в production появляются инфраструктурные задачи: долгие сессии, контроль поведения, стоимость результата, скорость инференса и новые сценарии атак.
В сегодняшнем дайджесте — пять свежих материалов прошедшей недели об этих задачах от OpenAI, AWS, NVIDIA и Anthropic.
1️⃣ Introducing the Agents API.
OpenAI открыла публичную бету Agents API для долгих агентных сессий: с автоматическим сжатием контекста, MCP и параллельной работой субагентов.
2️⃣ Monitoring production agent lifecycle with AWS DevOps Agent and AgentCore Evaluations.
AWS показывает двухуровневую наблюдаемость: AgentCore Evaluations оценивает качество работы агентов, а AWS DevOps Agent расследует инфраструктурные сбои по логам, метрикам и трассировкам.
3️⃣ Beyond the price per token: Choosing the right OpenAI model on Amazon Bedrock for your workload.
AWS предлагает воспроизводимую методику выбора модели по стоимости успешного результата. В расчёте учитываются точность, число ходов агента и качество итоговых материалов.
4️⃣ When to Use Encode-Prefill-Decode Disaggregation to Accelerate Multimodal Model Serving.
NVIDIA разбирает разделение encode, prefill и decode в мультимодальном инференсе. На запросах с большим числом изображений и короткими или средними ответами ускорение TTFT — до 5 раз, полного ответа — до 7 раз.
5️⃣ Detecting and countering misuse of AI: September 2026.
Отчёт Anthropic о выявленном использовании Claude в кибератаках: от разведки и поиска уязвимостей до групп агентов с постоянной памятью.
Качество ответа — только одна из метрик агентной системы. Для production также важны устойчивость сессий, задержки, стоимость и безопасность.
Post #5431
987

- 👍 1