Keye 2.0 от Kuaishou - интересный шаг для мультимодальных моделей: DeepSeek Sparse Attention впервые нормально утащили в задачу длинного видео.
Главная фишка - 256K контекста. Модель может разбирать часовые видео без типичного развала внимания, когда в начале ролика одно, в середине другое, а к концу модель уже теряет причинно-следственные связи.
Что важно:
- 30B MoE-модель с 3B активных параметров
- поддержка длинных видео и сложной временной логики
- prefill cost ниже примерно на 50%
- результат 74.10 на LongVideoBench
- на VideoMME V2 качество растёт при увеличении входа с 64 до 512 кадров: 35.34% → 42.44%
- есть фокус на timestamps, причинные цепочки, туториалы, игровые видео и длинные влоги
изменился контекст и почему это важно.
Веса уже открыты:
https://modelscope.ai/models/Kwai-Keye/Keye-VL-2.0-30B-A3B
Post #5243
4.86K

- ❤ 9
- 🔥 6
- 👍 4