R-Vision опубликовал статью о локальном запуске LLM для SOC на одной GPU
В материале рассматривается, как архитектура современных LLM влияет на требования к инфраструктуре, из чего складывается потребление видеопамяти, как рассчитывается конкурентность запросов и насколько теоретические оценки совпадают с результатами реальных стресс-тестов.
Эксперименты проводились на self-hosted-стенде с использованием Qwen3.5-122B-A10B-GPTQ, vLLM и RTX PRO 6000 Blackwell Max-Q с 96 ГБ GDDR7.
В статье на Хабр представлены подробные расчеты, результаты нагрузочного тестирования и практические выводы о локальном запуске больших языковых моделей для задач SOC.
Post #374
210
Forwarded from Sachok AI