Про эту модель уже несколько недель пишут "Opus 4.6 у себя дома". Нет, конечно. Но, черт, это первая небольшая локальная модель, которую я готов всерьез обсуждать в агентных сценариях, а не для чата по базе знаний.
Небольшие локальные модели (которые влезут в домашний GPU) на агентных задачах часто зацикливается, либо ломают tool-calling. Qwen 3.8 27B, пожалуй первая в моих тестах, у которой это не разваливается. На агентном индексе Artificial Analysis она #8 из 140 моделей, сразу за Kimi K2, которая в сто раз больше по параметрам, и реддите ее дружно хвалят и тд.
Мои тесты этой (и не только) модельки совпали с вполне прикладной задачей - выбрать железо для локального AI-периметра. Надо выбрать одновременно и модель, и железо. Для этого решил арендовать стенды на Vast.ai: 3090 за $0.13/час, там же брал 4090, 5090 и GB10 (тот же DGX Spark). Написал skill поверх их CLI, и дальше вместе с Claude поднимал и тушил машины для экспериментов, гонял бенчмарки по SSH и вел журнал. Десятки замеров, четыре типа железа, ряд моделей - все вместе примерно пару десятков баксов.
Вот на контрасте с соседями по весовой категории (уместиться в 5090 или пару 3090) плотная Qwen 3.8 и выстрелила. Единственная из всех стендов дважды нашла все 10 заложенных дефектов в тестовом договоре. 100 из 100 по tool-calling. На заведомо нерешаемой задаче остановилась за 4 шага и честно отчиталась, пока конкуренты (в том числе MoE) зацикливались. Ну и да - первая локальная модель, которая осилила мой лифтовый вайб-чек (посмотрите пост, в декабре у ChatGPT лифт не ехал!). Минусы тоже есть: например, модель требует высокой полосы (на маке и Spark работает медленно) и, главное - знаний о мире у 27B, заметно меньше. Но знания агенту приносят тулы и поиск, а вот дисциплину в цикле извне не принесешь.
Если присматриваетесь к локальному инференсу под агентов, вот что я бы хотел знать заранее:
1. Считайте секунды на шаг агента, а не только токены в секунду. У меня модель с втрое большим декодом делала шаг за 2.1 секунды против 1.2 у "медленной" и решала задачу за большее кол-во шагов.
2. Часто говорят только про память, но тут есть как минимум три оси. VRAM решает влезет ли модель и останется ли место под кэш. Пропускная способность памяти - очень важный параметр, влияет в первую очередь на скорость генерации ответа (поэтому старенькая 3090 все еще тащит). Compute решает, как быстро модель переваривает входящий промпт. Это упрощенно, вот например неплохой визуальный разбор roofline-модели. Отсюда следует много всего, например что при низкой полосе (на маках, спарках) лучше брать MoE модели.
3. Чат упирается в память, агент - в compute, контекст и кэш. Самое дорогое в агентном цикле - не ответ, а чтение промпта. Шагов много и на каждом шаге агент заново отправляет всю историю. Тут экстремально важен префикс-кэш.
4. Смена движка или его настроек может дать разницу в разы. Вариантов много: vLLM, SGLang, llama.cpp, кастомные движки вроде NInfer. Перебирать это руками долго, поэтому у меня этим занимался агент в стиле авторесерча: поднял ряд стендов, прогнал матрицу экспериментов параллельно, записал в журнал и тд.
5. Комьюнити уже прошло часть пути за вас: есть и готовые рецепты типа 3090-club и тулы вроде llmfit: сканирует железо и подтягивает реальные замеры других пользователей. Только эти бенчмарки регулярно не сходятся с реальностью. Тестируйте на своих задачах.
По итогам, кстати, для этой модели по соотношению цена/качество победила пара 3090. А самое интересное в этой системе - архитектура "советника": локальная модель делает всю работу, а для редких сложных вопросов зовет фронтир через строгий гейт, который не выпускает приватные данные за периметр. Но это уже отдельный пост.
upd: кстати, если хочется уже сейчас протестить, то у Валеры на neuraldeep она доступна бесплатно
🔥 ➕ 🔁 @nobilix