TGViewer
Love. Death. Transformers. Love. Death. Transformers. @lovedeathtransformers · 25.7K subscribers
Post #10857 7.68K

Forwarded from GigaDev — разработка GigaChat

GigaChat Audio и GigaAM Multilingual: новые Open Source модели с поддержкой длинного контекста и языков СНГ 🔥

Полноценные audio-native LLM — пока редкость в опенсорсе, а почти весь прогресс в Speech AI сфокусирован на английском языке и коротких аудио. Качество существующих открытых моделей резко деградирует на low-resource языках и длинных контекстах

Мы решили исправить обе проблемы и выкладываем в открытый доступ сразу две большие работы: расширенную версию GigaAM и новую GigaChat Audio с поддержкой длинных контекстов. Ценность обеих моделей и предложенных методов уже подтвердило научное сообщество — наши статьи приняли на главную мировую конференцию по речевым технологиям Interspeech 2026


GigaAM Multilingual
Расширение нашей SOTA-модели распознавания речи на казахский, киргизский, узбекский и английский
🔘 Self-supervised Audio Encoder (240M / 600M) — предобучен на 2M часов речи на 70+ языках с фокусом на СНГ. Адаптируется к новым языкам быстрее и дешевле, чем Whisper и Omnilingual: на грузинском и башкирском дообучились с одного Common Voice до Word Error Rate ~4% — против 11%+ у Whisper Encoder
🔘 Multilingual CTC ASR (240M / 600M) — дообучены на 50k часов мультидоменной речи (ru/en/uz/ky/kk). Превосходят Whisper, Seamless и Omnilingual; даже компактная 240M обгоняет Whisper Large v3 и Omnilingual 1B при кратно меньшем размере (средний WER 12.2% против 14%+)

📖 arXiv
🤗
ai-sage/GigaAM-Multilingual
👩‍💻 salute-developers/GigaAM


GigaChat Audio
Audio-native LLM на базе GigaAM Multilingual и GigaChat3.1-10B-A1.8B. Поддерживает multi-turn диалог, классификацию аудио, перевод и распознавание речи, и temporal grounding — локализацию событий во времени, описание интервала аудио и суммаризацию с временными метками
🔘 Сильнее всего — в понимании времени: на записях 20–60 минут Intersection-over-Union локализации событий 48.3 против ~0 у Voxtral, Phi-4 и Qwen3-Omni. Держит контекст до 2 часов аудио
🔘 Отлично понимает русский: RuBQ-Audio 60.0 (против 43.7 у Qwen3-Omni), распознавание эмоций Dusha 90%+
🔘 Представляем датасет TimeGround-1M — для обучения LLM привязке событий ко времени

📖 arXiv
🤗
ai-sage/GigaChat3.1-Audio-10B-A1.8B
🤗
ai-sage/TimeGround-1M


Попробовать в проде
Еще более мощные модели того же семейства доступны в наших сервисах:
🔘Обновленный GigaChat-Max-Audio — пользуйтесь на giga.chat и @gigachat_bot
🔘Распознавание на 5 языках — добавляйте в свои группы @smartspeech_sber_bot для распознавания голосовых


Что дальше
Проекту GigaAM уже третий год, и мы не перестаем его развивать: за последний квартал добавили таймстемпы для слов, конвертацию и запуск в Triton Inference Server, код дообучения под ваш домен и язык. Теперь выпустили в open-source и модель GigaChat-Audio, и уже обучаем следующий релиз. Следите за нашими обновлениями!
  • 🔥 57
  • 🤡 33
  • 👍 16
  • 💩 10
  • 🥴 5
  • ❤‍🔥 4
  • 🍓 2
  • 👏 1
  • 💊 1
More from @lovedeathtransformers
  1. Sep 26, 2026Self-Play Pretraining with Zero Data https://arxiv.org/abs/2609.30063
  2. Sep 25, 2026Evidence of Linear Superposition in LLMs Языковые модели ЕЩЁ ЛИНЕЙНЕЕ, чем мы думали. Это,…
  3. Sep 25, 2026вы ща охуеете, это были ДОМЕННЫЕ ТРОЛИ которые угнали имя на хф
  4. Sep 25, 2026код 200 мы вместе
  5. Sep 25, 2026после пары месяцев жизни в лондонске прям хочется написать роман антиутопию. Особенно остр…
  6. Sep 25, 2026забавный факт, карты nvidia дороже чем популярные наркотики, а к 2030 будут дороже чем кок…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →