Ждать 5 минут первого токена от ИИ — это не чат, это пакетное задание.
Именно так работал Qwen 3.5 122B на Mac Studio с контекстом 50 000+ токенов: модель помещалась в память, отвечала связно, но каждое следующее сообщение пересчитывало весь разговор с нуля. Причина — архитектура гибридного внимания, где рекуррентные SSM-слои нельзя просто «откатить», и кэш сбрасывался полностью.
Три бага в стеке обслуживания, а не в самой модели, делали её непригодной. После исправлений — мгновенные ответы даже на 130 000 токенах контекста.
Локальный инференс на потребительском железе реально работает. Просто стек нужно уметь готовить.
Разбираем ИИ-инструменты для бизнеса →
ИИ Инструменты | Контент-завод | База знаний
Post #141
26
