Я тут накатил еще моделей, самая большая которая мне понравилась по уму и качеству и по скорости, это gpt-oss-20b, это экспертная модель, MoE. Она на первый взгляд далеко не дура и на 3060 спокойно обрабатывается очень даже комфортно.
Я наверное уже задушил вас всех своими метриками. Похоже это очень мало кому интересно.
Но я тут сейчас тестирую нагрузку этой модели на одной карте 3060 и опубликую html файлик, представляющий собой отчет из k6
Кому будет интересно, там отчет нагрузка НА ОДНУ видеокарту 3060 с симуляцией в 600 одновременных пользователей. (Понарастающая нагрузка)
В отчете ошибка, модель GTP-OSS-20B, а не qwen 3.5 0.8b
Ну и да, она захлебнулась =)
Post #355
29