/local скачивает Qwen3.6-27B в 4 битах (около 15 ГБ, на диске нужен 21 ГБ), поднимает фоновый сервер с OpenAI-совместимым API и переключает агента на него. Бесплатно и без лимитов.Порог входа высокий, и JetBrains сами это признают: macOS 26, Mac на M5 и 64 ГБ памяти, а сама команда пока только в nightly-сборках. M5 выбран не из вредности: в его Neural Accelerator есть 8-битные инструкции, которых нет у M4, они дали около 40% к prefill, то есть к чтению файлов проекта, а на него у кодового агента уходит основное время. Плюс переиспользование KV-кэша между задачами и спекулятивное декодирование через черновую MTP-модель, примерно вдвое к скорости генерации. Патч обещают отправить в MLX-VLM.
Про качество: на внутреннем наборе JetBrains Qwen3.6-27B без reasoning набирает наравне с Sonnet 4.5 при лимите в 10 000 токенов рассуждений, GPT-5 на medium чуть выше. Reasoning у локальной модели отключён полностью: по их замерам он почти ничего не добавляет, но жжёт в 2–3 раза больше токенов, при этом облачные модели в сравнении шли с рассуждениями. Qwen3.8 по умолчанию не взяли, потому что ей reasoning нужен, и с ним задачи идут вчетверо медленнее; поставить её можно флагом
--model qwen3.8. Прототипы под DGX Spark и RTX 5090 есть, думают про карты на 24 ГБ.@neuro_channel