Тут пару дней назад релизнулись новые типапроизводительные модели qwen3 и все их хвалят
- https://t.me/artalog/1633
- https://t.me/itbeard/1738
А мне как раз сегодня(уже через час) лететь куда-то. И так как в полёте всё равно делать особо нечего, то можно по идее попрограммировать.
Мой выбор упал на ollama для запуска моделей, так как я уже давно её использую и вроде как терпимо всё работает. Но в этот раз без приключений не обошлось.
1. Сначала был гемор со скачиванием 30b модели. У меня ломалось скачивание модели на середине, так как стояла не последняя версия ollama(это я уже узнал потом через час мучений)
2. Потом эта штука начала тормозить и вылетать, так как не хватало памяти. Спасибо, закрыл лишние программы
3. После чего оказалось, что ни RooCode, ни Cline или Continue нормально работать с ними не хотят. Просто шлют какой-то свой промпт и уходят в бесконечный цикл(см. скриншот)
И только aider из-за его простоты и тупости нормально +- работал с ollama+qwen:30b
Благо, что есть 2 товарища выше, которые не настолько упороты, чтобы предпочитать консольные тулы как я. Они посоветовали LM Studio.
И это просто сказка по сравнению с ollama. Оно и ставится из brew, и сама скачивает оптимизированную модель именно под M архитектуру(так называемую MLX) и одной кнопкой экспоузит сервер для внешних приложений, и графический чат имеет. Радости полные штаны от человека, который не хочет заморачиваться с этим всем openai compatibility.
Если хотите всё же попробовать локальные модели, то
brew install --cask lm-studio
И особо не заморачивайтесь. Потом, если понадобится(прямо если реально понадобится), то уже будете упарываться и копаться внутри. А так - опенсорс опять сделать вроде как нормальный продукт, хоть и со второй попытки.
P.S. MLX версия на моём M1 Max+64RAM занимает всего лишь 22гига памяти для 50k токенов контекста и выдаёт 60 токенов в секунду, что весьма быстро.