TGViewer
KazDevOps KazDevOps @devopskaz · 6.87K subscribers
Post #1456 1.62K
🔥 Оптимизация ресурсов для инференса LLM без лишних сложностей

Если хотите не только обучить LLM, но и приручить ее (а выходные для этого само то 😂), мы поможем подобрать инфраструктуру.

Список полезных ресурсов помжет разобраться в настройке, тестировании и оптимизации больших языковых моделей:

⚪️ Модели и их документация

• Карточка модели Qwen2.5-32B-Instruct-AWQ на Hugging Face — содержит описание модели, параметры и инструкции по использованию.
• Документация по квантованию: GGUF, AWQ и GPTQ — полезно для понимания методов оптимизации памяти.

⚪️ Оценка и расчёт ресурсов

• Статья NVIDIA, как оценить требования к VRAM при выборе GPU для инференса.
• Онлайн-калькулятор VRAM LLM Calc — удобный инструмент для расчёта необходимой памяти в зависимости от параметров модели и квантования.

⚪️ Фреймворки для инференса

• Ollama — простой инструмент для локального инференса LLM.
• SGLang — фреймворк для ускорения инференса, с открытым кодом.
• VLLM — высокопроизводительный фреймворк для серверного инференса.
• Документация по настройке VLLM Engine Args — подробное описание параметров для оптимизации работы VLLM.

⚪️ Инструменты нагрузочного тестирования

Универсальные инструменты: Locust, k6, Gatling, Apache JMeter, Яндекс.Танк — подходят для тестирования производительности бэкендов.

⚪️ Инструменты NVIDIA для инференса:

• Perf Analyzer — утилита для анализа производительности инференса.
• Gen AI Perf — специализированный инструмент для LLM.
• Режимы Gen AI Perf: Analyze и Sessions — помогают анализировать производительность в различных сценариях.

⚪️ Бэкенды Triton для LLM

• VLLM Backend — интеграция VLLM с Triton Inference Server.
• TensorRT LLM Backend — бэкенд для ускорения инференса с использованием TensorRT.
• Triton CLI — упрощает импорт конфигураций и запуск инференса на Triton.

⚪️ Бенчмарки и сравнения

• TensorRT LLM Performance Overview — бенчмарки производительности TensorRT LLM от NVIDIA.
• Статья BentoML — сравнение различных бэкендов для инференса LLM.

Эта подборка охватывает все этапы работы с LLM: от выбора модели до тестирования производительности.


Пользуйтесь и делитесь с коллегами 🫡

@DevOpsKaz 😛
  • 🔥 4
  • ⚡ 3
  • 👍 3
  • ❤ 2
More from @devopskaz
  1. Oct 2, 2026🔥 Участвуйте в AWS Innovation Day 2026 — 22 октября, бесплатно Конференция об искусственн…
  2. Oct 2, 2026⚡️ State of AI Engineering 2026 Отчет Datadog «State of AI Engineering 2026» основан на ан…
  3. Oct 1, 2026🔥 Спикер №12 DevOpsDays Almaty'26 — Душеин Александр, архитектор облачных решений Yandex…
  4. Oct 1, 2026Post #2215
  5. Sep 30, 2026🔥 Перестаньте будить дежурных из-за CPU > 80% Каждый алерт, требующий немедленной реакции…
  6. Sep 29, 2026🔥 Спикер №11 DevOpsDays Almaty'26 — Нэлия Логинова, Head of Platform Technologies, Netcra…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →