TGViewer
Искра Искра @iskrachan · 2.61K subscribers
Post #128 406
🧠 Новая статья на Хабре: что значит развернуть LLM локально

Наш разработчик Дамир два дня поднимал модели на двух NVIDIA DGX Spark (128 ГБ памяти, vLLM, Qwen на 27B и 35B) и подключал их к Искре: две языковые модели плюс распознавание речи.

Что внутри:
▪️ почему совместимость — это матрица (архитектура CPU, поколение GPU, CUDA, квантизация), а не «модель + видеокарта»
▪️ как контекст 256K съедает память и оставляет один одновременный запрос
▪️ быстрая модель дала 77 токенов/с, но трижды нарушила инструкции — и её откатили
▪️ распознавание речи за 2 секунды, а весь сценарий — 106 секунд: где на самом деле уходит время

Главный вывод: локальный inference — это не свойство модели, а свойство всей системы вокруг неё.

Читать

#iskra cloud.iskrabot.ru
  • 👍 4
More from @iskrachan
  1. Sep 26, 2026🔥 Искра 2.75 - 26 сентября GitHub прямо в чате Подключайте репозиторий, читайте файлы, сл…
  2. Sep 25, 2026🧡 Поставьте Искре оценку в App Store или RuStore — для нас это важно! Попробуйте Искру на…
  3. Sep 22, 2026🔥 Искра 2.74 — 22 сентября Google Таблицы и Презентации Навык Google Drive теперь работае…
  4. Sep 21, 2026🔥 Искра 2.73 - 21 сентября Большая уборка В этом релизе сосредоточились на повышении надё…
  5. Sep 21, 2026❗️2026:09:21 – 13:48 Прямо сейчас видим ошибки в работе сервиса в связи с ростом нагрузок.…
  6. Sep 19, 2026🔥 Искра 2.72 - 19 сентября Лимиты выросли - цены прежние! Лимиты всех тарифов увеличились…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →