Обновленная инфраструктура Yandex AI Studio для долгоживущих сессий решает главную проблему агентных моделей — устойчивость и экономию при длительных цепочках рассуждений.
Основные моменты:
- Prefill / Decode Split — разделённые этапы инференса: быстрый prefill для контекста и стабильный decode для генерации.
- Иерархия KV-кэшей — GPU → CPU → распределённый слой.
- Переиспользование KV-кешей — контекст перемещается между серверами в реальном времени.
- Cache-aware балансировка — запросы направляются в ту часть кластера, где находятся нужные KV-кеши.
Появились и улучшения для enterprise-сред:
- Управляемые правила модерации ответов модели, возможность подключаться к нейросетям через частные эндпоинты по выделенному сетевому каналу для работы с ними без выхода в публичный интернет.
- Токены инструментов и токены кеширования — новая тарификация, где вычисления с переиспользованием контекста в агентских сценариях стоят до 4 раз дешевле.
https://ai.cnews.ru/news/line/2026-03-03_yandex_b2b_tech_otkryla_biznesu