SenseTime нарастила выдачу токенов в 10 раз за полгода — за счёт гетерогенных ускорителей
Продолжение поста
Поводом для переосмысления архитектуры стали особенности нагрузки в эпоху агентных сценариев: длинный контекст, многократные диалоговые витки и резкие всплески трафика — всё это плохо ложится на статичные схемы распределения ресурсов.
Архитектура SenseCore строится по двум направлениям. «Горизонтальная оркестрация» — единый реестр всех доступных ускорителей с описанием их пропускной способности, совместимости с моделями и объёма памяти под KV-кеш. Платформа управляет запросом на всём пути: приём, выполнение Prefill, передача KV-состояния, подхват на этапе Decode.
«Вертикальная оптимизация» — трёхуровневая настройка по цепочке «модель → движок → чип»: квантование весов и управление видеопамятью на уровне модели, параллельная обработка операций Attention и матричного умножения на уровне движка, тонкая настройка компилятора и планировщика памяти на уровне чипа.
Следующий шаг — переход от фиксированных пулов Prefill и Decode к пулам отдельных модулей: Encoder, Attention, FFN и блоки визуального кодирования получат собственные эластичные ресурсы. Это позволит точнее масштабировать каждый компонент под реальную нагрузку — что особенно актуально для мультимодальных моделей и архитектур MoE, где разные части модели нагружаются неравномерно.
Источник: QbitAI (🇨🇳)
#SenseTime #ИИинфраструктура #оптимизация
Post #2753
10