Недавно прикупил себе RTX 5080 с 16 GB на борту, запустил на ней Qwen 3 Coder на 30 миллиардов параметров с помощью LM Studio и потестировал с помощью opencode на спринговом проекте, как он будет справляться с типовыми задачами. В целом хочу сказать, что с задачами писать "по образу и подобию" такая модель справляется и даже умеет делать некоторый рефакторинг. Вначале работает шустро, затем чем больше делает правок и исправлений, тем сильнее замедляется, но продолжает работать. Через некоторое время правки вместо 5 минут занимают минут по 20. Но сами по себе правки остаются корректными. Поэтому по достижении более-менее устойчивого состояния надо сразу начинать новую сессию в кодинговом агенте.
В случае с LLM объём памяти является наиболее критичным параметром. И лучше брать побольше, хотя бы 24 гига. Но таких моделей в продаже очень мало и стоимость их возрастает в разы. Конечно для промышленной разработки такая видеокарта не подходит, но у локального решения есть другое неоспоримое преимущество: бесплатные токены и 100% доступность без ограничений. Вы платите разве что за электричество. Уже сейчас при желании можно составить некий бэклог простых заданий для такой модели и оставить её работать скажем на ночь. Утром можно провести ревью результатов и отправить их на следующую итерацию. То есть сейчас сфера применения локальных решений - это фоновые рутинные задачи, не критичные по времени.
Экстраполируя скорость развития AI-решений и рост цен на токены, я лишь убеждаюсь, что мы будем постепенно уходить от больших облачных моделей в сторону развёрнутых локально. Пусть не на локальном ПК, но как минимум в контуре организации. Особенно это актуально для России. Ведь даже бесплатные модели постоянно улучшаются и соответствуют топовым моделям (Qwen 3 Coder - это примерно GPT-4 по словам того же ChatGPT).
#devmark #ai #прогнозы #qwen #opencode
Post #186
228

- 🔥 6
- 👍 4
- 🏆 3
- 🤔 1