=== qwen3.8:27b ===
загрузка: 116.0 с, 52% на GPU
запуск 1: генерация 3.4 ток/с | промпт 26.3 ток/с | 256 токенов
запуск 2: генерация 3.1 ток/с | промпт 26.5 ток/с | 256 токенов
запуск 3: генерация 3.2 ток/с | промпт 24.4 ток/с | 256 токенов
=== qwen3.5:9b-q8_0 ===
загрузка: 64.9 с, 100% на GPU
запуск 1: генерация 30.8 ток/с | промпт 658.1 ток/с | 256 токенов
запуск 2: генерация 30.4 ток/с | промпт 665.0 ток/с | 256 токенов
запуск 3: генерация 30.6 ток/с | промпт 663.5 ток/с | 256 токенов
=== hf.co/unsloth/Qwen3.8-27B-GGUF:UD-Q4_K_XL ===
загрузка: 118.5 с, 57% на GPU
запуск 1: генерация 2.5 ток/с | промпт 2.4 ток/с | 256 токенов
запуск 2: генерация 2.5 ток/с | промпт 30.7 ток/с | 256 токенов
запуск 3: генерация 2.5 ток/с | промпт 30.1 ток/с | 256 токенов
=== hf.co/Abiray/Qwen3.6-35B-A3B-Q4_K_M-GGUF:Q4_K_M ===
загрузка: 148.4 с, 48% на GPU
запуск 1: генерация 20.3 ток/с | промпт 23.9 ток/с | 256 токенов
запуск 2: генерация 22.7 ток/с | промпт 63.9 ток/с | 256 токенов
запуск 3: генерация 22.7 ток/с | промпт 58.2 ток/с | 256 токенов
модель генерация промпт загрузка GPU итог
----------------------------------------------------------------------------------
qwen3.8:27b 3.2 т/с 26 т/с 116.0 с 52% на GPU медленно
qwen3.5:9b-q8_0 30.6 т/с 662 т/с 64.9 с 100% на GPU юзабельно
hf.co/unsloth/Qwen3.8-27B-GGUF:UD-Q4_K_XL 2.5 т/с 21 т/с 118.5 с 57% на GPU медленно
hf.co/Abiray/Qwen3.6-35B-A3B-Q4_K_M-GGUF:Q4_K_M 21.9 т/с 49 т/с 148.4 с 48% на GPU юзабельно
Выводы мщ этого можно сделать только после того, как проверю качество. Но скорость тут почти не отличима.
Я еще накачу разных квантований для 9b и можно будет закончить на этом на сегодня