TGViewer
Лаборатория Лиса Лаборатория Лиса @foxfoxcsharp · 80 subscribers
Post #354 38
Последние результаты
ГЕНЕРАЦИЯ, ток/с
модель 2k 8k 16k 32k 64k 128k
--------------------------------------------------------------------------------
Qwen3.5-9B:UD-Q2_K_XL 55.9 54.1 51.7 48.0 41.7 33.0
Qwen3.5-9B:UD-Q3_K_XL 48.6 47.8 45.9 42.4 37.4 30.2
qwen3.5:9b 38.1 42.6 40.8 39.7 35.2 28.7
Qwen3.5-9B:UD-Q4_K_XL 50.5 49.2 46.8 43.7 38.4 30.8
Qwen3.5-9B:Q5_K_M 44.5 46.2 44.5 41.5 36.7 22.9
Qwen3.5-9B:Q6_K 41.0 40.3 38.9 36.3 32.6 3.2
qwen3.5:9b-q8_0 30.9 30.4 29.8 28.8 13.8 1.6
qwen3.5:9b-bf16 2.1 2.9 1.7 1.1 1.2 0.6

ЧТЕНИЕ ПРОМПТА, ток/с
модель 2k 8k 16k 32k 64k 128k
--------------------------------------------------------------------------------
Qwen3.5-9B:UD-Q2_K_XL 1378 1461 1422 1350 1200 995
Qwen3.5-9B:UD-Q3_K_XL 1450 1628 1601 1494 1331 1086
qwen3.5:9b 1577 1688 1648 1526 1353 1100
Qwen3.5-9B:UD-Q4_K_XL 1486 1669 1643 1529 1359 1104
Qwen3.5-9B:Q5_K_M 1533 1614 1598 1481 1319 977
Qwen3.5-9B:Q6_K 1391 1558 1507 1423 1272 663
qwen3.5:9b-q8_0 1661 1749 1701 1602 962 440
qwen3.5:9b-bf16 401 497 436 383 402 309

ОЖИДАНИЕ ДО НАЧАЛА ОТВЕТА, с
модель 2k 8k 16k 32k 64k 128k
--------------------------------------------------------------------------------
Qwen3.5-9B:UD-Q2_K_XL 1.3 5.4 11.3 24.1 54.3 131.4
Qwen3.5-9B:UD-Q3_K_XL 1.3 4.9 10.1 21.7 49.0 120.4
qwen3.5:9b 1.2 4.7 9.8 21.3 48.2 118.9
Qwen3.5-9B:UD-Q4_K_XL 1.2 4.8 9.8 21.2 48.0 118.4
Qwen3.5-9B:Q5_K_M 1.2 4.9 10.1 21.9 49.5 133.9
Qwen3.5-9B:Q6_K 1.3 5.1 10.7 22.8 51.3 197.2
qwen3.5:9b-q8_0 1.1 4.5 9.5 20.3 67.8 296.9
qwen3.5:9b-bf16 4.6 16.0 36.9 84.8 162.1 422.9

ДОЛЯ МОДЕЛИ НА GPU, %
модель 2k 8k 16k 32k 64k 128k
--------------------------------------------------------------------------------
Qwen3.5-9B:UD-Q2_K_XL 100 100 100 100 100 100
Qwen3.5-9B:UD-Q3_K_XL 100 100 100 100 100 100
qwen3.5:9b 100 100 100 100 100 100
Qwen3.5-9B:UD-Q4_K_XL 100 100 100 100 100 100
Qwen3.5-9B:Q5_K_M 100 100 100 100 100 91
Qwen3.5-9B:Q6_K 100 100 100 100 100 81
qwen3.5:9b-q8_0 100 100 100 100 84 68
qwen3.5:9b-bf16 56 56 54 51 49 42


Выводы тут очевидные и говорят сами за себя.

Все равно очень круто, учитывая что я теперь знаю, что с 9b моделями можно делать интересные вещи.

В основном весь упор уходит в количество памяти у GPU, потому я сплю и вижу у себя что нибудь интересное на серваке.
More from @foxfoxcsharp
  1. Oct 7, 2026Вот более щедящий режим, тут хотя бы уже видно на каком моменте уже моделька начинает... Я…
  2. Oct 7, 2026Я тут накатил еще моделей, самая большая которая мне понравилась по уму и качеству и по ск…
  3. Oct 6, 2026Ну в общем === qwen3.8:27b === загрузка: 116.0 с, 52% на GPU запуск 1: генерация 3.4 ток/с…
  4. Oct 6, 2026Продолжаю эксперементировать с гнейронками, накатил относительно свежие модельки (До этого…
  5. Oct 6, 2026Может быть мне человек это сказал для успокоения, но тем не менее, он высказал свое мнение…
  6. Oct 5, 2026Ранее я недооценивал потенциал малых языковых моделей, полагая, что в умелых руках они спо…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →