Просто зацените бенчмарки токенов в секунду. Это ашалеть можно. Прикольно. Тестил только скорость генерации, не качество!
Конфиг Докер контейнера:
vCPU: 15
Nvidia RTX3060 12GB
RAM: 40 GB
И вот результаты, они уивительны.
=== qwen3.5:4b ===
загрузка: 27.5 с, 100% на GPU
запуск 1: генерация 61.3 ток/с | промпт 851.3 ток/с | 256 токенов
запуск 2: генерация 60.8 ток/с | промпт 868.1 ток/с | 256 токенов
запуск 3: генерация 62.0 ток/с | промпт 860.3 ток/с | 256 токенов
=== qwen3.5:9b ===
загрузка: 43.3 с, 100% на GPU
запуск 1: генерация 41.9 ток/с | промпт 648.5 ток/с | 256 токенов
запуск 2: генерация 41.9 ток/с | промпт 673.1 ток/с | 256 токенов
запуск 3: генерация 42.0 ток/с | промпт 672.3 ток/с | 256 токенов
=== qwen3.5:27b ===
^[[A загрузка: 115.4 с, 59% на GPU
запуск 1: генерация 2.5 ток/с | промпт 32.1 ток/с | 256 токенов
запуск 2: генерация 2.7 ток/с | промпт 29.9 ток/с | 256 токенов
запуск 3: генерация 2.7 ток/с | промпт 30.4 ток/с | 256 токенов
=== qwen3.5:35b ===
загрузка: 176.6 с, 48% на GPU
запуск 1: генерация 18.7 ток/с | промпт 15.6 ток/с | 256 токенов
запуск 2: генерация 21.4 ток/с | промпт 55.0 ток/с | 256 токенов
запуск 3: генерация 21.2 ток/с | промпт 58.5 ток/с | 256 токенов
=== qwen3.6:35b-a3b ===
загрузка: 146.3 с, 45% на GPU
запуск 1: генерация 21.1 ток/с | промпт 25.9 ток/с | 256 токенов
запуск 2: генерация 20.8 ток/с | промпт 58.9 ток/с | 256 токенов
запуск 3: генерация 24.3 ток/с | промпт 58.5 ток/с | 256 токенов
модель генерация промпт загрузка GPU итог
----------------------------------------------------------------------------------
qwen3.5:4b 61.4 т/с 860 т/с 27.5 с 100% на GPU юзабельно
qwen3.5:9b 41.9 т/с 665 т/с 43.3 с 100% на GPU юзабельно
qwen3.5:27b 2.7 т/с 31 т/с 115.4 с 59% на GPU медленно
qwen3.5:35b 20.4 т/с 43 т/с 176.6 с 48% на GPU юзабельно
qwen3.6:35b-a3b 22.1 т/с 48 т/с 146.3 с 45% на GPU юзабельно
Да, я понимаю что Qwen 3.5 35B это MoE, а 27b это полноразмерная, но все равено прикольно.
Эксперементы продолжаются. Сейчас накачу еще квантованных моделей.