🖥 Гайд по железу для open-source моделей в 2025 году
Мы уже писали как запускать у себя на компьютере локальные нейросети. Но сколько стоит "железо", если речь идет о полноценном локальном инференсе (и даже дообучении) средних open-source моделей, таких как Llama 3.1, Qwen 2.5 или DeepSeek R1?
➡️ Уровень 1: компактные решения
Это устройства для тех, кому нужна тихая, энергоэффективная работа с моделями малого размера. Они подойдут для RAG-систем, офисных ассистентов и разработки.
Устройства: MSI Cubi Z, Apple Mac mini/MacBook (M4).
Цена: $700–$2000. Например, Cubi Z стоит в районе $700.
Максимальная модель: комфортная работа с 7B–13B моделями, если у вас 16-32 ГБ ОЗУ.
Скорость: для 7B моделей (как Llama 3.1 8B) можно ожидать 30–80 токенов/сек. Для 13B моделей скорость будет ниже — около 10–20 токенов/сек.
➡️ Уровень 2: мощный десктоп
Это выбор для продвинутых разработчиков и исследователей, которым нужна высокая скорость на средних моделях и возможность полноценного обучения (например, StableDiffusionXL).
Устройства: сборный ПК с GPU типа NVIDIA RTX 5090 (32 ГБ VRAM).
Цена: $5000–$6000. Сама видеокарта стоит $3000–$4000.
Максимальная модель: легко запускает модели до 70B (иногда до 100B) с выгрузкой части на CPU.
Скорость: отличная скорость на 13B моделях — до 500–800 токенов/сек.
Минусы: шум, габариты и высокое энергопотребление (500–800 Вт).
➡️ Уровень 3: новое поколение
Эти системы предлагают огромный объем унифицированной памяти в компактном форм-факторе.
Устройство: Apple M4 Max (128 ГБ)
Цена: $4000–$5000
Максимальная модель: может запускать 70B модели (Llama 3.1 70B, Qwen 2.5 72B).
Скорость: для 70B моделей скорость невысокая — 7–10 токенов/сек. Этого достаточно для исследовательских задач, но медленно для продакшена.
Плюсы: тишина, мобильность, энергоэффективность.
Устройство: NVIDIA DGX Spark
Цена: $3999
Максимальная модель: 128 ГБ унифицированной памяти позволяют запускать модели вплоть до 200B параметров.
Обучение: в отличие от Mac позволяет полноценно дообучать модели до 70B.
Плюсы: готовое решение с полным стеком NVIDIA AI (CUDA) , по сути — суперкомпьютер на столе.
Минусы: ограничения на покупку (1 на пользователя), пока доступен не везде.
➡️ Уровень 4: серверный стандарт и кастомные сборки
Это решения для корпораций, production-задач и тех, кому нужна максимальная производительность на самых больших моделях.
Покупка сервера (A100 80GB)
Цена: от $25 000 за кастомный сервер
Максимальная модель: промышленный стандарт для 70B моделей.
Скорость: для Qwen 2.5 70B — 150–290 токенов/сек.
Кастомная сборка
Цена: около $6400 (8 карт по $800).
Максимальная модель: запускает 70B модели (DeepSeek R1 70B).
Скорость: 60 токенов/сек для 70B модели.
Минусы: требует серьезных технических навыков для настройки.
💬 Тест Тьюринга. События в сфере ИИ. Подписаться
Post #2083
552

- 👍 2
- ❤ 1
- 🔥 1
- 🤩 1