TGViewer
Киса | Deploy la Deploy Киса | Deploy la Deploy @deployladeploy · 8.32K subscribers
Post #2194 2.87K
Мб мне запустить локальные модели (часть 2)

Я поясню вам как устроен мой фреймворк и какие цифры можно выжать, а они по размеру, как мой средне-европейский хуй.


Читать строго начинать с части 1, никакого скипать. Онли кушать много букаф!

Значится, весь фреймворк базируется сразу на скилле и документации для агента, где отдельно разобрано агенту понимание как эти модели воркают.

Но смысл тут в том, что нейронка подключается и сразу знает, что вам скачать, как и где параметры поменять, чего вы получите на выходе на ваше железо.

Технически, я написал инструментарий и принципы, как модели под себя подгонять. А также добавил источники какие и откуда брать. А техническая база чужая: методы llama.ccp, apex и FreeToken.

Хотя в текущей реализации лично у меня это просто чужие apex модельки. Для меня лично самый гемовый инструмент, ноушилл темка.

Ну и на уже своих реальных тестах собрал исчерпывающую статистику, что в мое железо можно засунуть.

ЧТО ПО НАГРУЗКЕ

RTX 4060 8 ГБ + Ryzen 5 5600 + 32 ГБ RAM

- Qwen3.6-35B-A3B APEX-I-Compact в 32к контекста, 20 токенов в секунду
- Gemma 4 26B-A4B Heretic APEX-I-Balanced в 32к контекста, 10 токенов в секунду

В пике CPU грузился до 46-70%
GPU до 70-100%

При том, что расчет был в потреблении не на полную. Видео памяти не сжирало под модельку больше 5гб из 8гб.

Оперативки около половины. Агент может работать пока вы слушаете музыку, сидите в ТГ и серчите веб.

UPD: НАГРУЗКА В ПИКЕ С АГЕНТОМ ОДНОВРЕМЕННО! БУКВАЛЬНО БЕЗ НАДОБНОСТИ ХОТЬ ЧЕТ ВЫКЛЮЧИТЬ.


Из коробки реализованы от меня:

- Работает под llama-ui, модель его откроет в браузере. Этого UI более чем достаточно. Вариант юзать по умолчанию
- Навык вокруг openshell + Pi: соберет podman контейнер, изолирует от системы и даст вам строить личный харнесс
- Может поменять настройки Hermes, сделать модельку доступной там

В MVP версии весь упор сделан на LLM и метод именно от APEX, главным образом махинации с llama.cpp, а уже потом отдельный докрут самой модели.

Adaptive Precision for EXpert Models вот как это расшифровывается. Взял основу отсюда, шикарный вайбкод проект. APEX дополнительно экономит память, распределяя точность хранения весов. Он сильнее сжимает экспертов в середине сети, оставляя больше точности чувствительным крайним слоям и общим блокам.


Внутри лежат также методы прогона моделей, но придется брать большой запас памяти на диске, 80-100гб на создание модельки в 16-20гб.

Но как бы на HF уже полно моделей, агент скачивает готовую, переставляет параметры запуска: объем контекста, распределение нагрузки. Ну и вуаля, вы юзаете на локалке хорошую ллмку.

То есть агент делает нейронку под ваше железо и подключает в удобный вам интерфейс, врубая в фоне. Железо и мои результаты по моделям выше.

Как пользоваться?

1. Дать иишке ссылку
2. Попросить поставить X нейронку
3. Согласовать на сколько нагружать ваш ПК
4. Готово

Если есть желание, можно отдельно дать ссылку на модельку и попросить сделать из нее сжатую модельку. Либо найдет нужную, либо на вашем железе сделает.

Мой вердикт:

Это буквально локальные агенты, вайбкод едва ли сделают, могут затупить с отправкой/чтением файла. У них не 100% tools use, но в остальном оно работает.

С картинок изображение читает, с ллм вики работает, прогрев для гоев написать сможет. Чет потыкать в системе может.
  • 👍 18
  • 🔥 11
  • 😁 1
  • 🐳 1
More from @deployladeploy
  1. Sep 22, 2026Там кста вышло много новых моделей, я щас тестирую 6 соль и упомянутый грок 4.7. Так еще е…
  2. Sep 22, 2026Спустя почти год: новая статья Моя личная, из под моего пера, в моем телетайпе, если вы ещ…
  3. Sep 22, 2026Ради такого стоит заводить свои социальные сети и делать контент. <3
  4. Sep 22, 2026В статье я выложу все свои воркфлоу Для создания моделей, аниме, готовых видео. Последние…
  5. Sep 22, 2026Чтобы вы не подумали, что я сексист. Иногда я даже хвалю женщин. Лучше не стало, да? Я ког…
  6. Sep 22, 2026Мужик сказал — мужик сделал. Я пишу статью с детальным разбором каждого аспекта своего диз…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →