Добавили ее в сервис Evolution Foundation Models.
Новая модель использует MoE-архитектуру, которая включает Multi-head Latent Attention и Multi-Token Prediction, за счет чего достигается высокая скорость инференса. Ниже рассказываем о преимуществах модели 👇
GigaChat Lightning:
😶🌫️10B общих и 1.8B активных параметров — высокая производительность при низких требованиях к ресурсам
😶🌫️работает с vLLM, SGLang, Transformers — легко интегрируется в современные MLOps-пайплайны
😶🌫️эффективный инференс: высокая скорость генерации даже при большой размерности. благодаря оптимизациям в MTP-режиме
😶🌫️обучена на высококачественных данных
Есть в реестре российского ПО, данные обрабатываются и хранятся на территории РФ 🫡
Подключайте по OpenAI‑совместимому API и начинайте разработку.
Попробовать 🖱
