Я поясню вам как устроен мой фреймворк и какие цифры можно выжать, а они по размеру, как мой средне-европейский хуй.
Читать строго начинать с части 1, никакого скипать. Онли кушать много букаф!
Значится, весь фреймворк базируется сразу на скилле и документации для агента, где отдельно разобрано агенту понимание как эти модели воркают.
Но смысл тут в том, что нейронка подключается и сразу знает, что вам скачать, как и где параметры поменять, чего вы получите на выходе на ваше железо.
Технически, я написал инструментарий и принципы, как модели под себя подгонять. А также добавил источники какие и откуда брать. А техническая база чужая: методы llama.ccp, apex и FreeToken.
Хотя в текущей реализации лично у меня это просто чужие apex модельки. Для меня лично самый гемовый инструмент, ноушилл темка.
Ну и на уже своих реальных тестах собрал исчерпывающую статистику, что в мое железо можно засунуть.
ЧТО ПО НАГРУЗКЕ
RTX 4060 8 ГБ + Ryzen 5 5600 + 32 ГБ RAM
- Qwen3.6-35B-A3B APEX-I-Compact в 32к контекста, 20 токенов в секунду
- Gemma 4 26B-A4B Heretic APEX-I-Balanced в 32к контекста, 10 токенов в секунду
В пике CPU грузился до 46-70%
GPU до 70-100%
При том, что расчет был в потреблении не на полную. Видео памяти не сжирало под модельку больше 5гб из 8гб.
Оперативки около половины. Агент может работать пока вы слушаете музыку, сидите в ТГ и серчите веб.
UPD: НАГРУЗКА В ПИКЕ С АГЕНТОМ ОДНОВРЕМЕННО! БУКВАЛЬНО БЕЗ НАДОБНОСТИ ХОТЬ ЧЕТ ВЫКЛЮЧИТЬ.
Из коробки реализованы от меня:
- Работает под llama-ui, модель его откроет в браузере. Этого UI более чем достаточно. Вариант юзать по умолчанию
- Навык вокруг openshell + Pi: соберет podman контейнер, изолирует от системы и даст вам строить личный харнесс
- Может поменять настройки Hermes, сделать модельку доступной там
В MVP версии весь упор сделан на LLM и метод именно от APEX, главным образом махинации с llama.cpp, а уже потом отдельный докрут самой модели.
Adaptive Precision for EXpert Models вот как это расшифровывается. Взял основу отсюда, шикарный вайбкод проект. APEX дополнительно экономит память, распределяя точность хранения весов. Он сильнее сжимает экспертов в середине сети, оставляя больше точности чувствительным крайним слоям и общим блокам.
Внутри лежат также методы прогона моделей, но придется брать большой запас памяти на диске, 80-100гб на создание модельки в 16-20гб.
Но как бы на HF уже полно моделей, агент скачивает готовую, переставляет параметры запуска: объем контекста, распределение нагрузки. Ну и вуаля, вы юзаете на локалке хорошую ллмку.
То есть агент делает нейронку под ваше железо и подключает в удобный вам интерфейс, врубая в фоне. Железо и мои результаты по моделям выше.
Как пользоваться?
1. Дать иишке ссылку
2. Попросить поставить X нейронку
3. Согласовать на сколько нагружать ваш ПК
4. Готово
Если есть желание, можно отдельно дать ссылку на модельку и попросить сделать из нее сжатую модельку. Либо найдет нужную, либо на вашем железе сделает.
Мой вердикт:
Это буквально локальные агенты, вайбкод едва ли сделают, могут затупить с отправкой/чтением файла. У них не 100% tools use, но в остальном оно работает.
С картинок изображение читает, с ллм вики работает, прогрев для гоев написать сможет. Чет потыкать в системе может.
