Особенно доволен задачами поиска и фонового анализа кода, Большого кода.
ibm/granite-4-h-tiny - дает контекста в 1 048 576 токенов при крайне скромном потреблении памяти (всего 13,5 гигабайт в GPU, минимальные затраты для данного уровня контекста) и умеет дергать тулзы. Балуюсь с системным промтом, так как можно достигнуть и получше результата.В целом PearAI IDE + LM Studio/Ollama/Llama.cpp (тут что больше нравится) дают свободу для экспериментов.
Если хотите классики по типу Cursor - то качайте из каталога
claude3.5-4b-instruct, но при 128k контекста - придется отвалить 15.2-15.4 гигов видеопамяти. Вот вам классический (🙂) вайб-шкодинг Короче говоря, начинаю присматриваться к миру специализированных ускорителей под задачи подобного расчета, возможность масштабировать решения для промышленных применений за, скажем, приемлемые деньги даже для пользовательского сегмента.
