Опубликовали на Хабр технический разбор аудиомодальности GigaChat: архитектура, обучение, метрики и демо‑сценарии.
🔊 Зачем аудимодальность?
Связка распознавание речи (ASR) + GigaChat теряла смысловую информацию и не учитывала нюансы речи. End‑to‑end‑модель считывает звук напрямую и держит длинный аудиоконтекст.
🧠 Как учили
1. Audio-only Encoder Pre-training на 700k часов аудио.
2. Encoder ASR Fine-tuning на 100k часов аудио с транскрипциями.
3. Audio ⇄ Text Representations Alignment. С помощью облегчённого декодера
GigaChat Lite мы согласовываем векторы аудио-энкодера с латентным пространством LLM. Такой «тёплый старт» сокращает число итераций на следующем этапе и экономит GPU-время.4. Audio SFT
GigaChat 2 Max — 10k часов на широком спектре задач (ASR, QA, Captioning, function calling, long-form summarization, ...).📊 Результаты
• Side-by-Side
GigaChat Audio vs ASR + GigaChat: 0.68 vs 0.32 — GigaChat Audio отвечает по существу, без добавления ложной информации, лучше понимает термины и английскую речь, справляется с анализом сцены и слышимости речи.• Диалоговые свойства на русском языке на уровне GPT-4o (оценка людьми по 1200 диалогам в разрезе 7 критериев).
• Незначительная деградация базовых метрик: MMLU / IFEval просели ≤ 3 %.
• Обработка аудиозаписей до 170 минут.
Сценарии использования
• 📺 Краткое содержание — суммаризация часовых видео по аудиодорожке → https://giga.chat/link/gcscNrBMbT
• 🧑🎓 Языковой репетитор — интерактивная грамматика → https://giga.chat/link/gcsasCtOPX
• 📊 Анализ презентаций — темп, паузы, советы → https://giga.chat/link/gcsculCfiH
• 🌆 Описание звуковой сцены — неречевые аудио → https://giga.chat/link/gcsgenSGHJ
🖼 Экспериментальная мультимодальность: Vision + Audio
Последовательное дообучение позволяет поддерживать мультимодальный контекст без потерь в понимании изображений и аудио.
👉 Тестируйте уже сейчас: giga.chat или @gigachat_bot.
