TGViewer
Devs.kz Devs.kz @devs_kz · 10.6K subscribers
Post #7148 1.89K
GigaChat Audio и GigaAM Multilingual: новые Open Source модели с поддержкой длинного контекста и языков СНГ 🔥

Полноценные audio-native LLM — пока редкость в опенсорсе, а почти весь прогресс в Speech AI сфокусирован на английском языке и коротких аудио. Качество существующих открытых моделей резко деградирует на low-resource языках и длинных контекстах

Мы решили исправить обе проблемы и выкладываем в открытый доступ сразу две большие работы: расширенную версию GigaAM и новую GigaChat Audio с поддержкой длинных контекстов. Ценность обеих моделей и предложенных методов уже подтвердило научное сообщество — наши статьи приняли на главную мировую конференцию по речевым технологиям Interspeech 2026


GigaAM Multilingual
Расширение нашей SOTA-модели распознавания речи на казахский, кыргызский, узбекский и английский
🔘 Self-supervised Audio Encoder (240M / 600M) — предобучен на 2M часов речи на 70+ языках с фокусом на СНГ. Адаптируется к новым языкам быстрее и дешевле, чем Whisper и Omnilingual: на грузинском и башкирском дообучились с одного Common Voice до Word Error Rate ~4% — против 11%+ у Whisper Encoder
🔘 Multilingual CTC ASR (240M / 600M) — дообучены на 50k часов мультидоменной речи (ru/en/uz/ky/kk). Превосходят Whisper, Seamless и Omnilingual; даже компактная 240M обгоняет Whisper Large v3 и Omnilingual 1B при кратно меньшем размере (средний WER 12.2% против 14%+)

📖 arXiv
ai-sage/GigaAM-Multilingual
👩‍💻 salute-developers/GigaAM


GigaChat Audio
Audio-native LLM на базе GigaAM Multilingual и GigaChat3.1-10B-A1.8B. Поддерживает multi-turn диалог, классификацию аудио, перевод и распознавание речи, и temporal grounding — локализацию событий во времени, описание интервала аудио и суммаризацию с временными метками
🔘 Сильнее всего — в понимании времени: на записях 20–60 минут Intersection-over-Union локализации событий 48.3 против ~0 у Voxtral, Phi-4 и Qwen3-Omni. Держит контекст до 2 часов аудио
🔘 Отлично понимает русский: RuBQ-Audio 60.0 (против 43.7 у Qwen3-Omni), распознавание эмоций Dusha 90%+
🔘 Представляем датасет TimeGround-1M — для обучения LLM привязке событий ко времени

📖 arXiv
ai-sage/GigaChat3.1-Audio-10B-A1.8B
Dataset: ai-sage/TimeGround-1M
  • ❤ 3
  • 👏 2
  • 🔥 1
  • 🤡 1
More from @devs_kz
  1. Sep 22, 2026#вакансия 🚀 VoIP / Asterisk Engineer Формат: full-time 5/2, remote из некоторых стран (Аз…
  2. Sep 22, 2026Network School (международное сообщество людей, которые изучают технологии, работают удалё…
  3. Sep 22, 2026Devs.kz pinned «Ранее мы просили помощь с закрытым тестированием. https://t.me/devs_kz/730…
  4. Sep 22, 2026AI MONTH в Almaty Hub: дайджест мероприятий С 23 сентября по 23 октября по всему Казахстан…
  5. Sep 22, 2026Ранее мы просили помощь с закрытым тестированием. https://t.me/devs_kz/7308 Опубликовать а…
  6. Sep 22, 20262 билета на DevOpsDays от Devs.kz передаем двум участникам канала. Выбор будет сделан ранд…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →