Только вчера писал про локальные модельки, а сегодня вышли новые. QWEN 3 - это гибридные модели, в которых можно включать/выключать ризонинг. Из подобных на рынке сейчас только Gemini Flash 2.5, Claude 3.7 и DeepCogito. Кажется, что намечается новый тренд, что вполне логично, так как иметь возможность переключать ризонинг в рамках одной модели - намного удобнее, как минимум, с точки зрения UX. Помимо этого, у моделей можно регулировать “бюджет” на ризонинг, контролируя, как усердно она будет думать.
Если запускаете у себя, мышление отключается путем добавления в промпт
/no_thinkПо бенчмаркам все модели - SOTA в своих весовых категориях (будем проверять, у меня еще один перелет впереди 😁). При этом архитектура у них схожая с LLama - MOE. Т.е. всегда активными остается небольшое количество параметров модели, предъявляя меньше требований к железу.
Еще из интересного - я глянул в веб-интерфейс и заметил, что там появилась кнопка MCP с надписью “Coming Soon”, то есть в модельки скоро занесут компьютер юз, это прямо круто!
В целом, к моделям высокие ожидания, т.к. 2.5 версия была очень крутой, а благодаря своей опенсорсности много где использовалась. Напомню, что именно квен тюнили под себя Авито и Т-банк, поэтому ожидайте скорого обновления и у них 🙂
Потестировать модели в веб-интерфейсе можно тут
Hugging Face для тех, кто хочет локально - здесь