Привет! Я Вася Ершов, руководитель ML-команды Yandex Cloud. Расскажу, какой путь мы прошли, когда глобально обновили Yandex AI Studio, и как мы искали правильные технические решения для этого релиза.
В марте мы глобально обновили Yandex AI Studio: добавили DeepSeek-V3.2, запустили рассуждающих агентов и снизили стоимость инференса до 6 раз. Также внедрили новые инструменты безопасности: теперь данные можно передавать по выделенным каналам без логирования запросов.
Чтобы внедрить эти возможности, нам пришлось полностью пересмотреть инженерную составляющую платформы. Современные агентские LLM требуют полноценной распределённой inference-системы: с разделением prefill и decode, переносом KV-кэшей между узлами, маршрутизацией с учётом расположения кэша и контролем TTFT/TBT на уровне всего кластера.
Мало собрать GPU-кластер — нужно было ещё подобрать, интегрировать и доработать компоненты и сервисы так, чтобы вся эта конфигурация стабильно работала на нашем железе под реальной нагрузкой.
➡️ Узнать, как AI Studio устроена под капотом.








