MWS Cloud подсчитала: средняя стоимость минимальной инфраструктуры для запуска ведущей LLM в России выросла с 13,7 млн рублей в 2025 году до 38,8 млн в 2026-м.
Это не означает, что один и тот же сервер подорожал в 2,8 раза. Изменилось требование к оборудованию: прошлогодние модели часто помещались на четырёх GPU, а новые флагманы требуют целого узла из восьми H200 или B300. Цифра одновременно отражает санкционную наценку, рост цен на ускорители и увеличение самих моделей.
Какие модели с доступными весами теперь можно поселить в собственном ЦОД?
➡️ Kimi K3 — 2,8 трлн параметров, из которых 104 млрд активны. Минимум 8 × B300 по 288 ГБ. Цена в России — доходит до 80 млн рублей.
➡️ Qwen3.5 397B, DeepSeek-V4-Pro и GLM-5.2 — 8 × H200 по 141 ГБ. Цена около 55 млн рублей.
➡️ DeepSeek-V4-Flash — 1 × B300. Цена примерно 10 млн рублей.
➡️ Gemma 4 31B — 2 × H100. Цена около 7,5 млн рублей.
➡️ Российская Cotype Pro 3 — 1 × A100 80 ГБ. Цена около 3 млн рублей.
Причём это лишь «входной билет»: конфигурация способна загрузить модель и обработать один запрос максимального заявленного размера. Для параллельных пользователей, резервирования и приемлемой скорости понадобятся дополнительные мощности.
А сколько такое железо стоит за границей?
Американский сервер с восемью B300 выставлен за $496,7 тыс. — около 41,2 млн рублей по текущему курсу. Российская оценка аналогичной конфигурации (подойдет для Kimi K3) — 80 млн.
С H200 картина менее однозначна. Зарубежные предложения серверов на восьми ускорителях находятся в огромном диапазоне — примерно от $173 тыс. за базовую конфигурацию до $609 тыс. за комплект Supermicro с памятью, накопителями и сетевыми адаптерами.
Может быть, выгоднее арендовать?
За рубежом один H200 предлагается примерно за $4 в час. Узел 8 × H200 обойдётся примерно в $32 в час или $23 тыс. в месяц — около 1,9 млн рублей при непрерывной работе.
В России публичные тарифы начинаются примерно с 423 рублей за H200 в час. Восемь ускорителей — теоретически от 2,4 млн рублей в месяц. Однако для огромной модели нужны не восемь случайных виртуальных машин, а единый узел с NVLink/NVSwitch, поэтому фактическая цена обычно определяется индивидуально.
При покупке российского сервера за 55 млн рублей арифметическая точка окупаемости наступает примерно через 22 месяца непрерывной аренды. В реальности покупка окупается позднее: остаются электричество, охлаждение, размещение, персонал, ремонт и риск, что через два года оборудование устареет.
Поэтому собственный сервер имеет смысл при стабильной загрузке 24/7, жёстких требованиях к данным и горизонте эксплуатации от 2-3 лет.
Для пилота, нерегулярных задач и постоянной смены моделей аренда рациональнее.
А при небольшом трафике дешевле вообще не арендовать GPU, а покупать токены.
GLM-5.2 в MWS стоит 178 рублей за миллион входящих и 747 рублей за миллион исходящих токенов. При соотношении входа к выходу 3:1 месячная аренда на 2,4 млн рублей соответствует примерно 7,6 млрд обработанных токенов. До таких объёмов большинство компаний не добирается.
Открытые веса сделали модель доступной для скачивания. Но настоящая свобода теперь определяется не лицензией, а тем, можете ли вы позволить себе машину, на которой эта модель оживёт.
💬 Тест Тьюринга. События в сфере ИИ. Подписаться
