TGViewer
Нейролента Нейролента @nairolenta · 21 subscribers
Post #269 4
🛠 Домашний сервер для LLM на списанных V100 SXM2 дешевле RTX 3090

Списанные NVIDIA Tesla V100 SXM2 с 32 ГБ HBM2 и пропускной способностью 900 ГБ/с попадают на вторичный рынок по цене, несопоставимой с 24-гигабайтной RTX 3090: по данным Habr, модули 16 ГБ встречаются от $100–150, а конфигурация из двух 32 ГБ видеокарт с переходниками, платформой и охлаждением выходит около $1600. Для сравнения, RTX 3090 на вторичном рынке может стоить больше $1000 за 24 ГБ, RTX 5070 — около $550–570 за 12 ГБ. Итог: 64–128 ГБ VRAM в домашней стойке за цену, которая раньше уходила на один современный графический процессор.

Volta 2017 года не соперничает с RTX во всех задачах: 5120 CUDA-ядер, 640 Tensor-ядер, 300 Вт TDP на карту, нет DLSS Frame Generation и трассировки лучей. Но локальный запуск LLM сильнее упирается в объём VRAM и пропускную способность памяти, чем в поколение Tensor-ядер. Модель Qwen3.8-27B в квантовании Q4_K_M занимает около 24 ГБ, целиком помещается в одну V100 32 ГБ и выдаёт примерно 36,6 токена/с. RTX 5070 с 12 ГБ и 672 ГБ/с такие модели просто не удерживает без выгрузки части данных в ОЗУ.

Главный минус — не железо, а совместимость. PyTorch 2.11 в готовых двоичных сборках под CUDA 12.8/12.9 уже не поддерживает Volta: для V100 нужны CUDA 12.6 или собственная сборка под sm_70. Переходники SXM2→PCIe могут ограничивать шину режимом x8, не все выводят второй разъём под NVLink Bridge, а воздушное охлаждение пары карт — это киловатт тепла и шум, для четырёх уже больше 1,5 кВт. СЖО не опция, а необходимость для работы 24/7 рядом с человеком.

В оценочной таблице источник даёт такую производительность на $1000: 4× V100 — 107, 4× RTX 5070 — 92, 4× RTX 4070 Ti — 77, 4× RTX 3090 — 30. Это условные цифры, как и расчёт системы на 4× V100 за $2700 против $6700 за 4× RTX 3090. Но они указывают на главное: на вторичном рынке видеопамяти, подходящей для ИИ, иерархия перевернулась. Покупать Volta в 2026 году — значит делать ставку на объём VRAM и мириться с программным отставанием, которое PyTorch уже начал ускорять; такая сборка выигрывает только для тех, кто готов вручную собирать драйверы и не считает счета за электричество.

#V100 #NVIDIA #локальныйLLM #инференс #Volta
More from @nairolenta
  1. Sep 24, 2026🛠 MCP не был плохой идеей — он решает совсем другую задачу Вопрос «MCP всегда был плохой…
  2. Sep 23, 2026🚀 Jev от TypeSafe AI — LLM, который отвечает числами TypeSafe AI представила Jev — первую…
  3. Sep 23, 2026📊 За 11 недель агент нашёл 77 ошибок, человек — 16 Одиннадцать недель автор статьи на Hab…
  4. Sep 23, 2026📊 10-кратное ускорение кодирования дало проекту лишь 22% Десятикратное ускорение написани…
  5. Sep 23, 2026🛠 Агент для написания кода за 30 дней: код быстрее, релиз медленнее Тридцать дней с агент…
  6. Sep 23, 2026🚀 Цены на GPT-6 упали вдвое: Luna теперь $0.10/млн Вчера Anthropic представила Claude Opu…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →