Канал Облакотеки https://oblakoteka.ru | Здесь Cloud Native компании находят друг друга и общаются про технологии не очень далекого будущего.
Редакция: @chashkinanna
Post #637
168

Добро пожаловать в реальную нагрузку
А у нас свежий кейс! Партнер Облакотеки Виталий Сидоров (CEO «АйТи Спейс») активно гоняет инференс Qwen в реальной работе — и за две недели такого теста успел найти то, чего не смогли увидеть за месяц на «синтетике».
Кейс получился большим, поэтому рассказывать будем в нескольких частях. Сегодня — о том, как инференс тестировали и «ломали» ⬇️.
У одного из самых надежных и любимых партнеров Облакотеки — Виталия Сидорова — есть потребность в LLM. У него к одной точке подключено пять провайдеров языковых моделей: DeepSeek, Alibaba, Kimi, Яндекс, ГигаЧат. Мы дали шестую модель, свой инференс QWEN 3.8-27B и две недели смотрели, что из этого выйдет.
❓ Зачем столько моделей
Виталий пишет код под свои задачи. Людей на ревью нет, QA тоже, самому это делать некогда. Поэтому один агент разрабатывает, два других ревьюят. Модели обязательно разные: своя модель не видит собственных галлюцинаций. Код проходит несколько циклов и на выходе становится адекватным.
❓ Какая была нагрузка
➡️ Пакет документов по ПД. Это порядка 30 документов и чек-листов, по которым надо проверить свою подсистему 1С. Пакет гоняли через модели в несколько итераций с ревью.
➡️ Раунды разработки приложения Privacy Gateway. Это локальная прокси, которая перед отправкой запроса в облачную модель подменяет чувствительные данные на заглушки, а в ответе возвращает настоящие, так что с LLM можно работать, не выпуская свои данные наружу.
У Виталия было так: один агент пишет и отдает ревьюерам, те гоняют модели и возвращают правки. Здесь он подключил Qwen через OpenCode как одного из ревьюеров, и наша модель получила регулярную нагрузку.
Отдельно отметим то, что Виталий делать не стал. Продакшн и админский контур, где у него агентское администрирование облаков, он не подключал сознательно. Все идет через его собственный LiteLLM с кэшем, и настоящей нагрузки мы бы не увидели.
❓ Что ломалось
Ради этого тест и затевался: поймать баги на живой нагрузке, пока за сервис никто не платит.
Сбоев было два, и Виталий описал их одинаково: модель перестала отвечать. В логах причины оказались совершенно разные.
1️⃣ Первый — баг движка инференса. Роутер оборвал долгий запрос по таймауту, но движок не получил команду остановиться и продолжал генерировать ответ в пустоту, заняв реплику. Клиент ошибки не увидел: стрим просто оборвался с успешным кодом. Фоллбэку не на что было сработать, и агент простоял до утра.
2️⃣ Второй мы устроили сами. Выкатывали новую конфигурацию движка, реплики по очереди выпадали, запросы обрывались на третьей минуте по таймауту шлюза. В тот же день включили дневной лимит, Виталий выбрал его к вечеру, и дальше шли отказы. Отказ — явная ошибка, так что здесь фоллбэк сработал.
❓ Что в итоге
Баг был закрыт в штатной версии движка, таймаут шлюза поднят с трех минут до пятнадцати, обновления выкатываются по одной простаивающей реплике.
В результате модель делает то, ради чего ее ставили: Qwen в режиме рассуждения хорош на ревью кода. Это оценка Виталия после двух недель работы.
P. S. Во второй части расскажем, что показала статистика по реальной нагрузке, сколько это стоило бы у публичных провайдеров и почему инференс под агентов — отдельный продукт.
#искусственно_интеллектуально
😏 Облакотека | TG | MAX
А у нас свежий кейс! Партнер Облакотеки Виталий Сидоров (CEO «АйТи Спейс») активно гоняет инференс Qwen в реальной работе — и за две недели такого теста успел найти то, чего не смогли увидеть за месяц на «синтетике».
Кейс получился большим, поэтому рассказывать будем в нескольких частях. Сегодня — о том, как инференс тестировали и «ломали» ⬇️.
У одного из самых надежных и любимых партнеров Облакотеки — Виталия Сидорова — есть потребность в LLM. У него к одной точке подключено пять провайдеров языковых моделей: DeepSeek, Alibaba, Kimi, Яндекс, ГигаЧат. Мы дали шестую модель, свой инференс QWEN 3.8-27B и две недели смотрели, что из этого выйдет.
❓ Зачем столько моделей
Виталий пишет код под свои задачи. Людей на ревью нет, QA тоже, самому это делать некогда. Поэтому один агент разрабатывает, два других ревьюят. Модели обязательно разные: своя модель не видит собственных галлюцинаций. Код проходит несколько циклов и на выходе становится адекватным.
❓ Какая была нагрузка
➡️ Пакет документов по ПД. Это порядка 30 документов и чек-листов, по которым надо проверить свою подсистему 1С. Пакет гоняли через модели в несколько итераций с ревью.
➡️ Раунды разработки приложения Privacy Gateway. Это локальная прокси, которая перед отправкой запроса в облачную модель подменяет чувствительные данные на заглушки, а в ответе возвращает настоящие, так что с LLM можно работать, не выпуская свои данные наружу.
У Виталия было так: один агент пишет и отдает ревьюерам, те гоняют модели и возвращают правки. Здесь он подключил Qwen через OpenCode как одного из ревьюеров, и наша модель получила регулярную нагрузку.
Отдельно отметим то, что Виталий делать не стал. Продакшн и админский контур, где у него агентское администрирование облаков, он не подключал сознательно. Все идет через его собственный LiteLLM с кэшем, и настоящей нагрузки мы бы не увидели.
❓ Что ломалось
Ради этого тест и затевался: поймать баги на живой нагрузке, пока за сервис никто не платит.
Сбоев было два, и Виталий описал их одинаково: модель перестала отвечать. В логах причины оказались совершенно разные.
1️⃣ Первый — баг движка инференса. Роутер оборвал долгий запрос по таймауту, но движок не получил команду остановиться и продолжал генерировать ответ в пустоту, заняв реплику. Клиент ошибки не увидел: стрим просто оборвался с успешным кодом. Фоллбэку не на что было сработать, и агент простоял до утра.
2️⃣ Второй мы устроили сами. Выкатывали новую конфигурацию движка, реплики по очереди выпадали, запросы обрывались на третьей минуте по таймауту шлюза. В тот же день включили дневной лимит, Виталий выбрал его к вечеру, и дальше шли отказы. Отказ — явная ошибка, так что здесь фоллбэк сработал.
❓ Что в итоге
Баг был закрыт в штатной версии движка, таймаут шлюза поднят с трех минут до пятнадцати, обновления выкатываются по одной простаивающей реплике.
Вывод для тех, кто пишет агентов: оборванный стрим с успешным кодом — это не успех. Фоллбэк должен срабатывать и на него, а самому агенту нужен свой таймаут, иначе он будет ждать вечно.
В результате модель делает то, ради чего ее ставили: Qwen в режиме рассуждения хорош на ревью кода. Это оценка Виталия после двух недель работы.
P. S. Во второй части расскажем, что показала статистика по реальной нагрузке, сколько это стоило бы у публичных провайдеров и почему инференс под агентов — отдельный продукт.
#искусственно_интеллектуально
😏 Облакотека | TG | MAX
- 👍 6
- 🔥 3
- ❤ 1
- 🤔 1













