TGViewer
Ученый без степени | AI-блог Ани Ученый без степени | AI-блог Ани @applied_scientist_blog · 834 subscribers
Post #165 1.17K
Почитала тех репорт 🔗Fun-Audio-Chat — LALM (Large Audio Language Model) от Tongyi Team (Alibaba). Интересно, что теперь большинство конкурентов в сравнительных таблицах это другие китайские модели (Kimi-Audio, GLM4-Voice, …), опенсорс-гонка сместилась, такое время. По бенчмаркам уже становится сложно делать однозначные выводы, результаты смешанные в зависимости от задачи

Тем не менее в статье нашла пару интересных архитектурных и тренировочных решений 👇

Архитектура

⏺Модель в двух версиях: 8B (опенсорс, на основе Qwen3-VL-8B) и MoE 30B-A3B (30B параметров, 3B активных)
⏺Whisper-large-v3 audio encoder
⏺Семантические токены S3Tokenizer от CosyVoice V3

🥺 Dual-Resolution Speech Representations

Модель генерит текст и речевые токены авторегрессионно. При этом у нее две головы: текстовая (по одному токену за шаг генерации) и аудио голова (k=5 токенов за шаг). И здесь появляется проблема audio-LLM: temporal rate mismatch. Текст генерится со скоростью ~3 Hz (токенов в секунду), а речь ~25 Hz (зависит от токенов конечно).

Решение такое: (см. картинку)

Grouping (25 Hz → 5 Hz): на вход LLM каждые k=5 последовательных речевых токенов конкатенируются и проецируются в эмбеддинг. Длина последовательности сокращается в 5 раз. Далее мерджат с текстовым эмбеддингом

Speech Refined Head (SRH): из output'а LLM отдельная голова разворачивает сгруппированные эмбеддинги обратно в 25 Hz токены, авторегрессионно генерируя 5 токенов за группу.


🍸 Core-Cocktail training

Классическая проблема мульти-модального обучения: если файнтюнить LLM на аудио-данных с высоким learning rate, то модель быстро учится новой модальности, но забывает текстовые способности. Если с низким, то обучение стагнирует. Из 🔗DrVoice (их же статья) есть конкретные цифры: после агрессивного fine-tuning текстовые метрики падают с 81.77 до 70.19, что существенно.

Тренируем агрессивно, потом частично откатываем:

🔴Фаза 1: full fine-tuning с высоким LR (LLM, энкодера, адаптера). Модель сдвигает параметры в сторону мультимодальности.

🟣Intermediate merge: интерполируем веса обученной модели M₁ с исходной LLM M₀: M_r = α × M₁ + (1-α) × M₀. В тех репорте используют α=0.5, то есть 50/50 микс.

💚Фаза 2: продолженное обучение с низким LR для стабилизации

Результат из DrVoice такой: после merge и фазы 2 текстовые метрики восстанавливаются до 74.73.

Интересно, что в DrVoice для маленькой модели использовали α=0, то есть полный откат к исходной LLM (при этом аудио-энкодер, SRH и адаптеры сохраняют обученные веса). В Fun-Audio-Chat уже α=0.5, но авторы не показывают, как это влияет на метрики. Хотелось бы увидеть сравнение.

🐱 Чего не хватило

Авторы упоминают мульти-таск DPO стейдж для устойчивости к шумным аудио, instruct-following и voice empathy, но нет деталей. Ни таблиц, ни абляций. Для сравнения, их же статья 🔗Fun-ASR содержит куда больше подробностей про RL пост-тренинг.

Также авторы упоминают full-duplex версию, но я не разобралась, как она поддерживает параллельный аудио-стрим пользователя вместе с генерацией модели. Если кто разобрался, напишите пожалуйста, как устроена параллельная обработка входящего аудио?
  • ❤ 10
  • 👍 3
  • ✍ 2
  • 🍾 1
More from @applied_scientist_blog
  1. Dec 25, 2025Год подходит к концу, поэтому самое время подводить итоги. В этом посте разбираю одну из ц…
  2. Dec 22, 2025✨ Meta выпустила 🔗SAM Audio, модель для open-domain audio separation. В отличие от класси…
  3. Dec 16, 2025Давно не было разборов. А все потому, что последние ~1,5 месяца я много собеседовалась. 🐹…
  4. Nov 7, 2025Генерация речи с LLM задача нетривиальная, мы тренируем модель воспроизводить наиболее вер…
  5. Nov 3, 2025В далеком 2020 году вывели степенные законы масштабирования для pre-training. Теперь коман…
  6. Oct 29, 2025Хороший пост от разработчика PyTorch с обзором внутреннего устройства фреймворка пост 2019…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →