TGViewer
Data Scientist | ML & AI Data Scientist | ML & AI @datascience_tg · 3.05K subscribers
Post #975 687
🔖 Не вся инфраструктура для локальных LLM одинаково быстрая

Ollama отлично подходит для быстрого старта, но если нужна максимальная производительность, многие переходят на vLLM.

Автор собрал практически всё, что влияет на скорость инференса: выбор видеокарты, работу с VRAM, квантизацию, настройку llama.cpp, KV-кэш, MoE-модели и множество практических рекомендаций.

⛓️ Ссылка на GitHub

tags: #полезное

➡ Data Scientist | Чат
  • ❤ 2
  • 👍 1
  • 🔥 1
More from @datascience_tg
  1. Sep 25, 2026🔖 Открытый Jev почти догнал оригинал Bespoke Labs выпустила Nimble — открытую модель на б…
  2. Sep 25, 2026Если ты ждёшь знака, что пора валить в IT за границу, то вот он. IT — одна из немногих сфе…
  3. Sep 24, 2026📰 Что можно запустить в три строки через Transformers В статье есть примеры по: 🫡 Анализ…
  4. Sep 23, 2026🔖 Дообучаем open-source модели прямо в Google Colab С Unsloth можно дообучать 500+ открыт…
  5. Sep 23, 2026📰 Как построить первую ML-модель с нуля В статье пошагово разбирают базовый ML-пайплайн н…
  6. Sep 22, 2026🔖 Статистику лучше учить через задачи, а не бесконечную теорию An Introduction to Statist…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →