TGViewer
Eli Rum - Tech & Ai Eli Rum - Tech & Ai @somecrazyhands · 580 subscribers
Post #65 120
🔥 64–128 ГБ HBM2 для локального AI за цену одной современной видеокарты

Я сейчас подбираю себе конфигурацию для локального инференса: хочу начать с недорогого рига, а затем постепенно масштабироваться до моделей класса 70B–120B.

И нашёл совершенно безумного китайского Франкенштейна: готовую машину с четырьмя NVIDIA Tesla V100 SXM2, жидкостным охлаждением и NVLink.

Версия за $2 223:

• 4 × V100 SXM2 16 ГБ HBM2 — суммарно 64 ГБ VRAM;
• до 900 ГБ/с пропускной способности памяти на каждой карте;
• NVLink 2.0 — продавец заявляет 300 ГБ/с;
• Xeon E5-2698B v3, X99-TF, 64 ГБ RAM и SSD 1 ТБ;
• отдельная R5 240 для вывода изображения;
• два блока питания по 1000 Вт;
• четыре водоблока и готовый корпус 1CatAI QX620A.

Вот сам лот:

https://www.alibaba.com/product-detail/4-GPU-V100-16GB-graphics-card_1601670638004.html

Важно: 4 × 16 ГБ — это не одна видеокарта с единой памятью на 64 ГБ. Модель должна быть распределена между GPU через tensor/pipeline parallelism или layer split.

На такой конфигурации нормально выглядят:

• gpt-oss-20b;
• Qwen/Gemma-класс 27–35B в AWQ/GGUF;
• 70B-модели в Q4/Q5;
• Stable Diffusion, FLUX и другие задачи, где важен объём VRAM.

А вот для gpt-oss-120b версия на 64 ГБ уже слишком тесная: OpenAI ориентирует модель на одну 80-гигабайтную GPU. Веса почти помещаются, но не остаётся нормального запаса под KV-cache и runtime.

Поэтому интереснее версия 4 × V100 32 ГБ — уже 128 ГБ HBM2 за $4 363:

https://www.alibaba.com/product-detail/4-GPU-V100-32GB-graphics-card_1601666431506.html

И это уже реально риг для 120B-класса. Автор даже сделал 1Cat-vLLM — отдельный форк vLLM под Volta/V100.

В нём описан запуск Qwen3.5-122B-A10B-AWQ на четырёх V100 32 ГБ через TP4 и с контекстом до 256K:

https://github.com/1CatAI/1Cat-vLLM

Но V100 — на архитектуре 2017 года:

• нет нативных BF16/FP8/FP4-кернелов новых поколений;
• CUDA 13 уже убрала сборку библиотек под Volta, поэтому стек придётся фиксировать на CUDA 12.x;
• современные RTX/A100/H100 будут заметно быстрее;
• это китайская кастомная плата плюс списанные серверные GPU — перед оплатой нужны ECC-логи, nvidia-smi topo -m и тест NVLink.

Что по альтернативам?

По текущему вторичному рынку:

• 4 × RTX 3090 = 96 ГБ, примерно $4 200 только за GPU;
• 2 × RTX A6000 = 96 ГБ, примерно $7 600;
• одна RTX PRO 6000 Blackwell 96 ГБ сейчас стоит около $13 000.

То есть 4 × V100 32 ГБ дают максимальный объём VRAM за деньги, но ценой старого software stack и инженерных приключений.

Аренда тоже интересна:

• 4 × V100 на Vast.ai: примерно $0,74–1,61/час;
• A100 80 ГБ на Runpod: $1,39/час;
• RTX PRO 6000 96 ГБ: $2,09/час;
• H100 SXM 80 ГБ: $3,29/час.

При работе 24/7 это примерно от $538 до $2 402 в месяц.

Покупка 128-гигабайтного V100-рига формально отбивается за 2–4 месяца непрерывной аренды — но без учёта электричества, доставки, налогов и разницы в скорости.

А вот API пока убивает локальную сборку по чистой экономике.

gpt-oss-120b стоит:

• DeepInfra — $0,039 за 1 млн входных и $0,19 за 1 млн выходных токенов;
• Groq, Together и Fireworks — около $0,15 / $0,60.

Даже 10 000 запросов в месяц по 10K входа + 2K выхода — это примерно $7,70 на DeepInfra или $27 у остальных.

Поэтому локальный риг нужен не ради «сэкономить на ботике». Он нужен, когда важны:

• закрытые данные и полный on-prem;
• собственные веса, LoRA и нестандартные модели;
• постоянная высокая нагрузка (RAG/GRAPH-RAG)
• отсутствие rate limits и оплаты за каждый токен;
• возможность ковырять весь inference stack самому.

Короче, рационально — API, если есть бабки. Инженерно и стратегически — мне очень нужно собрать этого 128-гигабайтного монстра чтобы строить дальше https://gerts.ai так как пока я его строю много и много раз гоняю переиндексацию докуметов а это уже выходит дороговато. Если честно то за несколько лет я сжег денег на 30+ KUSD по грубым прикидкам.

Что думаете?

#ai #elirum #aisdlc #llm #vibecoding #development
  • 👍 3
  • 🔥 3
  • 👀 1
More from @somecrazyhands
  1. Aug 18, 2026v0️⃣.3️⃣4️⃣.0️⃣ ForgePlan v0.34 - что нового. Главное: инструмент перестал врать. Версия п…
  2. Aug 18, 2026Давненько не было релизов в ForgePlan, вчера задеплоил новую версию.
  3. Aug 14, 2026Всем привет! Ваш покорный весной записывал курс для Hitch (red_mad_robot) https://ai.hitch…
  4. Aug 7, 2026Пока технологии несутся а люди борются за еду наперегонки с тостерами и кофемолками ИИ Я р…
  5. Aug 5, 2026Без ИИ как без рук. Назад больно Поделюсь историей, которая случилась со мной на прошлой н…
  6. Aug 4, 2026Про вайб кодинг на удаленке. 🔹 Многие наверное видели вот эти посты из каждого утюга где…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →