TGViewer
Поляков считает: AI, код и кейсы Поляков считает: AI, код и кейсы @countwithsasha · 6.61K subscribers
Post #772 3.31K
Поляков считает: AI, код и кейсы Qwen3.8-27B на DGX Spark: балл как у Sonnet 5, скорость как у стажёра Гоняю новую dense-модель Qwen на коробке под столом. Результаты противоречивые ровно настолько, чтобы о них стоило написать. 🏆 Агентный бенчмарк: вровень с фронтиром Прогнал PAC1 — набор…
Qwen3.8-27B на DGX Spark: обогнал Sonnet 5 в PAC-1 и стал быстрее.

Ваш покорный слуга искал способ, как усокрить работу модели. 12-18 токенов в секунду, это конечно очень мало. Плюс есть префилл, хочется немного быстрее получать результат.

Нашёл инструкцию на официальном форуме https://forums.developer.nvidia.com/t/qwen3-8-27b-at-34-38-tok-s-on-dgx-spark-open-source-one-command-setup-sglang-nvfp4-dspark/380257

Это вариант спекулятивного декодинга, когда для предсказания токенов берётся отдельная модель.

📏 Что по статистике

Автор приводит свои замеры:

llama - 27 т/с
vLLM - 24 т/с
SGLang - 34 т/с


Я решил что хочу 34 т/с и пошёл тестировать.

На русском языке получилась деградация, но если работать с кодом или JSON будет очень приятный рост. Прикладываю статистику.

⚠️ Проблема с шиной никуда не девается

Префил по прежнему долгий, на длинных инструкциях первого токена прийдется ждать прилично, но всё равно быстрее чем префилл на vLLM.
Первый токен за 250 мс, а не за 1500 для русского текста.

🔥 Прогнал PAC-1 и модель обошла Опус

Когда начал тестировать генерацию JSON и программирование, то впервые увидел 72 и 44 ток/с. На Nvidia DGX Spark это очень круто. Решил запустить бенч PAC-1 и модель обогнала Opus 4.8.

Скорость прогона обошла наивный запуск без декодинга в 2 раза: уходило по 100 минут на прогон, но это всё равно долго в сравнении с Qwen 3.6 35b a3b. Но взаимодействие в задачах кодинга стало приятнее.

😀 Забавно, что код на питоне генерируется быстрее кода на TypeScript (см. скриншоты)


🙋🏻‍♂️ А что по бизнес задачам?

У рекламных агентств есть неприятная задачка: отчётность по маркировке рекламы в ОРД. Нельзя сказать, что она прям сложгная, у меня давно есть скилл, который позволяет клод опусу создавать таблицы для загрузки.
Но в этот раз я отдал эту задачку агенту на Pi у которого под капотом был Qwen 3.8 27B, и он справился. Правда за 30 минут.

Кто уже тестил маленькие локальные модели на бизнес задачах? Как результаты?

----

Поляков считает — AI, код и кейсы
  • ❤ 6
  • 👍 4
  • 🔥 3
More from @countwithsasha
  1. Sep 19, 2026SEO-аудит. Затестил скилл разработчика из Кишинева и мне очень зашло Я периодически расска…
  2. Sep 17, 2026Весной рассказывал про реддит-скилл. Но не рассказал, что моё приложение быстро забанили К…
  3. Sep 16, 2026Немного про пет-проекты в области ИИ Месяц назад мы с командой единомышленников без лишних…
  4. Sep 15, 2026Скилл Яндекс.Директа: что добавил за неделю после релиза На прошлой неделе я выложил скилл…
  5. Sep 11, 2026Диплинки в кодинговых агентах Deeplinks - простой, но иногда незаменимый прием для быстрог…
  6. Sep 11, 2026Плюсую теме, которую поднимает Рефат. Диплинки в кодинговых агентах реально круто упрощают…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →