Ваш покорный слуга искал способ, как усокрить работу модели. 12-18 токенов в секунду, это конечно очень мало. Плюс есть префилл, хочется немного быстрее получать результат.
Нашёл инструкцию на официальном форуме https://forums.developer.nvidia.com/t/qwen3-8-27b-at-34-38-tok-s-on-dgx-spark-open-source-one-command-setup-sglang-nvfp4-dspark/380257
Это вариант спекулятивного декодинга, когда для предсказания токенов берётся отдельная модель.
📏 Что по статистике
Автор приводит свои замеры:
llama - 27 т/с
vLLM - 24 т/с
SGLang - 34 т/с
Я решил что хочу 34 т/с и пошёл тестировать.
На русском языке получилась деградация, но если работать с кодом или JSON будет очень приятный рост. Прикладываю статистику.
⚠️ Проблема с шиной никуда не девается
Префил по прежнему долгий, на длинных инструкциях первого токена прийдется ждать прилично, но всё равно быстрее чем префилл на vLLM.
Первый токен за 250 мс, а не за 1500 для русского текста.
🔥 Прогнал PAC-1 и модель обошла Опус
Когда начал тестировать генерацию JSON и программирование, то впервые увидел 72 и 44 ток/с. На Nvidia DGX Spark это очень круто. Решил запустить бенч PAC-1 и модель обогнала Opus 4.8.
Скорость прогона обошла наивный запуск без декодинга в 2 раза: уходило по 100 минут на прогон, но это всё равно долго в сравнении с Qwen 3.6 35b a3b. Но взаимодействие в задачах кодинга стало приятнее.
😀 Забавно, что код на питоне генерируется быстрее кода на TypeScript (см. скриншоты)
🙋🏻♂️ А что по бизнес задачам?
У рекламных агентств есть неприятная задачка: отчётность по маркировке рекламы в ОРД. Нельзя сказать, что она прям сложгная, у меня давно есть скилл, который позволяет клод опусу создавать таблицы для загрузки.
Но в этот раз я отдал эту задачку агенту на Pi у которого под капотом был Qwen 3.8 27B, и он справился. Правда за 30 минут.
Кто уже тестил маленькие локальные модели на бизнес задачах? Как результаты?
----
Поляков считает — AI, код и кейсы





