Какая конфигурация GPU выгоднее для запуска open-source модели: одна премиальная карта или две среднего сегмента?
Мы протестировали инференс Qwen3-32B на A100 (80 ГБ) и двух A5000 (48 ГБ суммарно) в сценарии с умеренной длиной запроса и ответа, Q4-квантизацией и некритичными требованиями к скорости генерации, а затем посчитали стоимость обработки 1 млн токенов.
▪️ Результат: две A5000 обработали тот же объем в 3,6 раза дешевле. В рамках этого сценария они оказались быстрее за счет гибкости в распределении нагрузки и эффективного масштабирования batch-size. Запас VRAM на A100 преимущества не дал: модель использовала лишь 37% памяти.
▪️ У связки карт среднего сегмента есть и минусы: A5000 работают медленнее A100 по абсолютной скорости генерации на поток, и в сценариях, где latency критична, это будет иметь значение.
▪️ A100 оправдана, когда задача выходит за рамки этих условий: модели крупнее 48 ГБ, длинный контекст, высокие требования к скорости или сложные пайплайны. Вопрос в том, чтобы платить за мощность только тогда, когда сценарий ее действительно требует.
Полный разбор с параметрами теста, методикой расчета и чек-листом оптимизации затрат на AI-инфраструктуру опубликовали в нашем блоге.
🔗 Читать полную статью
