🧠 Новая статья на Хабре: что значит развернуть LLM локально
Наш разработчик Дамир два дня поднимал модели на двух NVIDIA DGX Spark (128 ГБ памяти, vLLM, Qwen на 27B и 35B) и подключал их к Искре: две языковые модели плюс распознавание речи.
Что внутри:
▪️ почему совместимость — это матрица (архитектура CPU, поколение GPU, CUDA, квантизация), а не «модель + видеокарта»
▪️ как контекст 256K съедает память и оставляет один одновременный запрос
▪️ быстрая модель дала 77 токенов/с, но трижды нарушила инструкции — и её откатили
▪️ распознавание речи за 2 секунды, а весь сценарий — 106 секунд: где на самом деле уходит время
Главный вывод: локальный inference — это не свойство модели, а свойство всей системы вокруг неё.
Читать
#iskra cloud.iskrabot.ru
Post #128
406
- 👍 4