TGViewer
CONTENTRUN КОНТЕНТРАН CONTENTRUN КОНТЕНТРАН @contentrunai · 69 subscribers
Post #141 26
Ждать 5 минут первого токена от ИИ — это не чат, это пакетное задание.

Именно так работал Qwen 3.5 122B на Mac Studio с контекстом 50 000+ токенов: модель помещалась в память, отвечала связно, но каждое следующее сообщение пересчитывало весь разговор с нуля. Причина — архитектура гибридного внимания, где рекуррентные SSM-слои нельзя просто «откатить», и кэш сбрасывался полностью.

Три бага в стеке обслуживания, а не в самой модели, делали её непригодной. После исправлений — мгновенные ответы даже на 130 000 токенах контекста.

Локальный инференс на потребительском железе реально работает. Просто стек нужно уметь готовить.

Разбираем ИИ-инструменты для бизнеса →
ИИ Инструменты | Контент-завод | База знаний
More from @contentrunai
  1. Aug 24, 2026Post #185
  2. Aug 10, 2026Открытая модель не отклонила ни одного запроса на хакерские операции. Ни одного. GLM-5.2 о…
  3. Aug 9, 2026Эксперты получают от ChatGPT больше — не потому что умеют «лучше промптить». Математик Тер…
  4. Aug 8, 2026✨ — это больше не «красиво». Это теперь официальный символ ИИ. Каждая эпоха оставляет след…
  5. Aug 8, 2026ChatGPT Work на мобиле и десктопе — это два разных инструмента. Мало кто это знает. Когда…
  6. Aug 7, 2026Claude взломал три реальные компании. Случайно. Аnthropicпровела тест наступательных кибер…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →