⚡️ Гибридные модели теперь - полноценные граждане в vLLM
По мере роста длины контекста классический attention всё хуже масштабируется: KV-кеш раздувается линейно, а prefill бьёт по задержкам квадратичным ростом.
Отсюда - всплеск интереса к гибридным архитектурам, где внимание смешивается с SSM, линейным attention и другими эффективными слоями.
В vLLM V1 такие модели стали first-class: единое управление состояниями (и KV-кеш, и SSM-стейт), оптимизации через CUDA Graphs, улучшенное префикс-кеширование. Это сильно повышает throughput на длинных последовательностях и моделях c MoE.
Итог: гибридные модели выходят в продовый стандарт - быстрее, дешевле по памяти и лучше подходят для LLM с большим контекстом.
Подробнее в статье: https://pytorch.org/blog/kernelfalcon-autonomous-gpu-kernel-generation-via-deep-agents/
Post #3061
2.83K

- ❤ 1
- 👍 1