TGViewer
GigaDev — разработка GigaChat GigaDev — разработка GigaChat @gigadev_channel · 5.25K subscribers
Post #72 18.5K
GigaChat Audio и GigaAM Multilingual: новые Open Source модели с поддержкой длинного контекста и языков СНГ 🔥

Полноценные audio-native LLM — пока редкость в опенсорсе, а почти весь прогресс в Speech AI сфокусирован на английском языке и коротких аудио. Качество существующих открытых моделей резко деградирует на low-resource языках и длинных контекстах

Мы решили исправить обе проблемы и выкладываем в открытый доступ сразу две большие работы: расширенную версию GigaAM и новую GigaChat Audio с поддержкой длинных контекстов. Ценность обеих моделей и предложенных методов уже подтвердило научное сообщество — наши статьи приняли на главную мировую конференцию по речевым технологиям Interspeech 2026


GigaAM Multilingual
Расширение нашей SOTA-модели распознавания речи на казахский, киргизский, узбекский и английский
🔘 Self-supervised Audio Encoder (240M / 600M) — предобучен на 2M часов речи на 70+ языках с фокусом на СНГ. Адаптируется к новым языкам быстрее и дешевле, чем Whisper и Omnilingual: на грузинском и башкирском дообучились с одного Common Voice до Word Error Rate ~4% — против 11%+ у Whisper Encoder
🔘 Multilingual CTC ASR (240M / 600M) — дообучены на 50k часов мультидоменной речи (ru/en/uz/ky/kk). Превосходят Whisper, Seamless и Omnilingual; даже компактная 240M обгоняет Whisper Large v3 и Omnilingual 1B при кратно меньшем размере (средний WER 12.2% против 14%+)

📖 arXiv
🤗
ai-sage/GigaAM-Multilingual
👩‍💻 salute-developers/GigaAM


GigaChat Audio
Audio-native LLM на базе GigaAM Multilingual и GigaChat3.1-10B-A1.8B. Поддерживает multi-turn диалог, классификацию аудио, перевод и распознавание речи, и temporal grounding — локализацию событий во времени, описание интервала аудио и суммаризацию с временными метками
🔘 Сильнее всего — в понимании времени: на записях 20–60 минут Intersection-over-Union локализации событий 48.3 против ~0 у Voxtral, Phi-4 и Qwen3-Omni. Держит контекст до 2 часов аудио
🔘 Отлично понимает русский: RuBQ-Audio 60.0 (против 43.7 у Qwen3-Omni), распознавание эмоций Dusha 90%+
🔘 Представляем датасет TimeGround-1M — для обучения LLM привязке событий ко времени

📖 arXiv
🤗
ai-sage/GigaChat3.1-Audio-10B-A1.8B
🤗
ai-sage/TimeGround-1M


Попробовать в проде
Еще более мощные модели того же семейства доступны в наших сервисах:
🔘Обновленный GigaChat-Max-Audio — пользуйтесь на giga.chat и @gigachat_bot
🔘Распознавание на 5 языках — добавляйте в свои группы @smartspeech_sber_bot для распознавания голосовых


Что дальше
Проекту GigaAM уже третий год, и мы не перестаем его развивать: за последний квартал добавили таймстемпы для слов, конвертацию и запуск в Triton Inference Server, код дообучения под ваш домен и язык. Теперь выпустили в open-source и модель GigaChat-Audio, и уже обучаем следующий релиз. Следите за нашими обновлениями!
  • 🔥 91
  • 👍 38
  • 🎉 17
  • 👏 4
  • ❤‍🔥 3
More from @gigadev_channel
  1. Sep 10, 2026🧠 GigaChat 3.5 Reasoning — первая в России открытая модель с рассуждениями Выкладываем в…
  2. Aug 25, 2026💵 GigaEmbeddings: новая линейка моделей от 480M до MoE-флагмана 10B-A1.8B Мы обновили всю…
  3. Jul 27, 2026💚Хотите познакомиться с командой GigaChat лично? Встречаемся 29 июля! Никаких докладов и…
  4. Jul 6, 2026💵 GigaChat 3.5 Ultra: меньше, быстрее, сильнее Сегодня мы выкладываем в open source GigaC…
  5. Jul 2, 2026💵 GFusion: как мы обучали диффузионную LLM в GigaChat «А что, если LLM будет генерировать…
  6. Jun 17, 2026💵Deep Research как управляемый runtime вокруг instruct-модели «Просто дать LLM доступ к и…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →