TGViewer
AI.Insaf AI.Insaf @ai_tablet · 1.19K subscribers
Post #246 836
Хотел почеленджить ребят на работе, что развернуть модельки просто. А именно попробовав серверные истории SGLang, vLLM или Triton. А вот от llama.cpp отказался, тк больше про локальный инференс, хотя через lm studio было бы легко

Но везде оказались свои подводные камни. И как итог, Qwen3.8-9B-GGUF (Q4/Q5) вообще плохо поддерживается vLLM. Патч под Qwen 3.5 от некого чувака, который 24 часа делал его на Fable, тоже не помог. Плюс были проблемы с CUDA DLL и ZMQ.

При этом исходные оригинальные веса зачастую требуют слишком много памяти, а квантованные, которые собирают сторонние люди, уже поддерживаются заметно хуже.

Потом попробовал Gemma 4 E4B (safetensors и QAT самые разные версии), но vLLM и SGLang тоже не завелись из-за проблем с совместимостью compressed-tensors и мультимодальными особенностям, спасибо еще heterogeneous attention head dimensions

PS qwen 3.8 27b локально это прогрев
  • 🫡 4
  • 💅 2
  • 😁 1
More from @ai_tablet
  1. Sep 29, 2026Хороший друг Никита Зелинский со школой ml inside запускает курс по AI-агентам для продакт…
  2. Sep 21, 2026Agents Trust Tools Too Much (arxiv) Почему-то агенты слишком доверяют вызовам тулов как ед…
  3. Sep 20, 2026Measuring LLM Sycophancy under Sustained Multi-Turn Pressure (arxiv) Сложное название для…
  4. Sep 12, 2026Post #252
  5. Sep 9, 2026MemTrapBench: Benchmarking Cognitive Traps in LLM Memory Use (arxiv) Забавная статья, в ко…
  6. Sep 7, 2026Feedback That Backfires arxiv Контринтуитивный вывод в статье. Дефакто в harness-решениях…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →