TGViewer
Лаборатория Лиса Лаборатория Лиса @foxfoxcsharp · 79 subscribers
Post #349 33
Продолжаю эксперементировать с гнейронками, накатил относительно свежие модельки (До этого я юзал 2.5 только Квины, сейчас поставил 3.5 и обновил OLlama)

Просто зацените бенчмарки токенов в секунду. Это ашалеть можно. Прикольно. Тестил только скорость генерации, не качество!

Конфиг Докер контейнера:
vCPU: 15
Nvidia RTX3060 12GB
RAM: 40 GB


И вот результаты, они уивительны.
=== qwen3.5:4b ===
загрузка: 27.5 с, 100% на GPU
запуск 1: генерация 61.3 ток/с | промпт 851.3 ток/с | 256 токенов
запуск 2: генерация 60.8 ток/с | промпт 868.1 ток/с | 256 токенов
запуск 3: генерация 62.0 ток/с | промпт 860.3 ток/с | 256 токенов

=== qwen3.5:9b ===
загрузка: 43.3 с, 100% на GPU
запуск 1: генерация 41.9 ток/с | промпт 648.5 ток/с | 256 токенов
запуск 2: генерация 41.9 ток/с | промпт 673.1 ток/с | 256 токенов
запуск 3: генерация 42.0 ток/с | промпт 672.3 ток/с | 256 токенов

=== qwen3.5:27b ===
^[[A загрузка: 115.4 с, 59% на GPU
запуск 1: генерация 2.5 ток/с | промпт 32.1 ток/с | 256 токенов
запуск 2: генерация 2.7 ток/с | промпт 29.9 ток/с | 256 токенов
запуск 3: генерация 2.7 ток/с | промпт 30.4 ток/с | 256 токенов

=== qwen3.5:35b ===
загрузка: 176.6 с, 48% на GPU
запуск 1: генерация 18.7 ток/с | промпт 15.6 ток/с | 256 токенов
запуск 2: генерация 21.4 ток/с | промпт 55.0 ток/с | 256 токенов
запуск 3: генерация 21.2 ток/с | промпт 58.5 ток/с | 256 токенов

=== qwen3.6:35b-a3b ===
загрузка: 146.3 с, 45% на GPU
запуск 1: генерация 21.1 ток/с | промпт 25.9 ток/с | 256 токенов
запуск 2: генерация 20.8 ток/с | промпт 58.9 ток/с | 256 токенов
запуск 3: генерация 24.3 ток/с | промпт 58.5 ток/с | 256 токенов

модель генерация промпт загрузка GPU итог
----------------------------------------------------------------------------------
qwen3.5:4b 61.4 т/с 860 т/с 27.5 с 100% на GPU юзабельно
qwen3.5:9b 41.9 т/с 665 т/с 43.3 с 100% на GPU юзабельно
qwen3.5:27b 2.7 т/с 31 т/с 115.4 с 59% на GPU медленно
qwen3.5:35b 20.4 т/с 43 т/с 176.6 с 48% на GPU юзабельно
qwen3.6:35b-a3b 22.1 т/с 48 т/с 146.3 с 45% на GPU юзабельно


Да, я понимаю что Qwen 3.5 35B это MoE, а 27b это полноразмерная, но все равено прикольно.

Эксперементы продолжаются. Сейчас накачу еще квантованных моделей.
  • 🔥 2
More from @foxfoxcsharp
  1. Oct 7, 2026Вот более щедящий режим, тут хотя бы уже видно на каком моменте уже моделька начинает... Я…
  2. Oct 7, 2026Я тут накатил еще моделей, самая большая которая мне понравилась по уму и качеству и по ск…
  3. Oct 7, 2026Последние результаты ГЕНЕРАЦИЯ, ток/с модель 2k 8k 16k 32k 64k 128k ----------------------…
  4. Oct 6, 2026Ну в общем === qwen3.8:27b === загрузка: 116.0 с, 52% на GPU запуск 1: генерация 3.4 ток/с…
  5. Oct 6, 2026Может быть мне человек это сказал для успокоения, но тем не менее, он высказал свое мнение…
  6. Oct 5, 2026Ранее я недооценивал потенциал малых языковых моделей, полагая, что в умелых руках они спо…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →