🚀 Локальная LLM на слабом железе: первый опыт
Всем привет!
Последние несколько дней я решил поэкспериментировать с запуском локальной LLM. Дорогого железа у меня пока нет, поэтому всё тестировалось на Ubuntu 24.04 на моём старом ноутбуке:
🖥 GTX 1060 (6 GB VRAM)
🧠 16 GB RAM
⚙️ старенький Intel i7
По нынешним меркам — железо, мягко говоря, не космос 🚀
Но, внезапно, оно вполне уверенно потянуло Qwen 2.5 3B. Возможно, пойдёт и что-то ещё — я только пару дней как ковыряюсь в этой теме, так что это первая публикация из серии, продолжение будет в ближайшие дни.
🎯 Цель
Для начала я решил с нуля подготовить Ubuntu для запуска Qwen.
Первая цель — получить CLI-интерфейс для работы с моделью.
В итоге схема оказалась довольно простой.
🛠 Как я это настраивал
1️⃣ Драйверы NVIDIA
Ставим последние драйверы для видеокарты:
apt-get update
ubuntu-drivers devices
⚠️ Важно: для нормальной работы мне понадобились драйверы версии 570+, не те, что ставятся по умолчанию.
2️⃣ NVIDIA CUDA SDK
Нужно установить cuda-toolkit-12-8, именно через скачивание .deb файла и подключение репозитория.
3️⃣ Инструменты сборки
Я хотел собирать всё из исходников, чтобы при желании можно было твикать под себя, поэтому понадобятся:
gcc, g++
cmake
ninja
и прочая базовая dev-обвязка
4️⃣ Качаем llama.cpp
Просто клонируем репозиторий с GitHub.
5️⃣ Компиляция
Собираем через cmake, обязательно:
явно указать путь к nvcc
добавить флаг -DGGML_CUDA=ON
6️⃣ Hugging Face (hf)
Ставим hf — тулзу для скачивания моделей.
Нюансы:
нужно авторизоваться (у меня даже временная почта прокатила)
получаете токен → тулза начинает работать
сам портал, если честно, довольно странный:
интерфейс а-ля GitHub, но хуже
целиком модель не скачать
git lfs не работает без особой авторизации
иногда перед скачиванием надо зайти на сайт и кликнуть «я согласен» (непонятно с чем 😅)
hf периодически ловит 403, хотя с сайта всё качается нормально
👉 Для Qwen всё упрощается — нужен всего один .gguf файл, так что терпимо.
В целом: хотели как лучше, а получилось как всегда (как говорил классик).
7️⃣ Готово
В итоге у вас есть:
llama-cli
llama-server
файл модели qwen.gguf
Больше ничего не нужно. Можно запускать, скриптовать и экспериментировать.
🤖 Немного про процесс
Делал я всё это вместе с GPT-5.2 — с ним Linux и open source внезапно становятся вполне юзабельными 😄
Всю нашу переписку я попросил оформить в полноценный гайд.
Он лежит в прикреплённых файлах, там:
все команды
пошаговая инструкция
без воды
📊 Результаты на моём железе
⏳ Загрузка модели в память: 10–15 секунд
💬 Простые ответы: 5–10 секунд
🧠 Контекстное окно: примерно 8000 байт
📝 Только текст
🧮 Можно запускать на CPU
→ примерно в 5 раз медленнее, но работает
💬 Вопрос к вам
Если у кого-то есть полезные советы
(кроме «купи 5090 за 500к» 😄) — буду рад увидеть их в комментариях.
Надеюсь, материал окажется полезным.
Жду фидбэк, идеи и опыт из первых рук 🙌
Всем удачи и отличного дня! ☀️
Post #514
544