TGViewer
Machinelearning Machinelearning @ai_machinelearning_big_data · 278K subscribers
Post #9898 24.9K
🌟 Audio Flamingo Next: открытая аудио-языковую модель от NVIDIA

Audio Flamingo Next (AF-Next) - аудио-языковая модель, обученная на корпусе из 1 млн часов аудио и 108 млн примеров для генерации подробных текстовых описаний аудиозаписей: перечисление инструментов, звуковых событий и музыкальных характеристик того, что звучит на записи. Максимальная длина входного аудио - 30 минут.

Релиз закрывает отставание мультимодальных систем в работе со звуком: речью, музыкой и окружающими шумами на длинных записях.

🟡Архитектура собрана из 4-х блоков:

🟢Кодировщик AF-Whisper (128-канальная лог-мел-спектрограмма, окно 25 мс, шаг 10 мс, выход 50 Гц);
🟢Двухслойный MLP-адаптер;
🟢Qwen-2.5-7B с расширенным контекстом 128K токенов;
🟢Потоковый TTS-модуль для голосовых диалогов.

Фишка архитектуры - Rotary Time Embeddings: угол поворота токена привязывается к реальной временной метке аудио, что дает модели устойчивое временное рассуждение.

🟡Релиз состоит из 3-х версий

AF-Next-Captioner: модель, заточенная под детальное описание аудио. Она генерирует подробные текстовые описания аудиозаписей: перечисляет инструменты, звуковые события, спикеров и музыкальные характеристики того, что звучит на записи, с привязкой к таймкодам.

На распознавании инструментов Medley-Solos-DB она набирает 92,13 против 85,80 у Audio Flamingo 2.

На музыкальных описаниях SongCaps, где качество оценивает GPT-5, показатели покрытия и корректности выросли с 6,7 и 6,2 у AF3 до 8,8 и 8,9.


AF-Next-Instruct: универсальная инструктивная версия, после GRPO для повседневных задач: ответов на вопросы по аудио, голосовых ассистентов, транскрипции речи и перевода.

Именно она устанавливает новые планки среди LALM по ASR.

WER 1,54 на LibriSpeech. На LongAudioBench 73,9 против 60,4 у закрытой Gemini 2.5 Pro (в варианте с речью разрыв еще больше - 81,2 против 66,2.)


AF-Next-Think: ризонинг-версия с Temporal Audio Chain-of-Thought: модель привязывает каждый шаг рассуждения к конкретной временной метке в аудио, что делает ее пригодной для разбора длинных записей, где нужно собирать факты из разных моментов (анализа совещаний, интервью, подкастов, трейлеров и сюжетных аудиоисторий).

75,01 на MMAU-v05.15.25 и 58,7 на более жестком MMAU-Pro, что выше, чем у Gemini-2.5-Pro (57,4).



📌Лицензирование: NVIDIA OneWay Noncommercial License.


🟡Страница проекта
🟡Arxiv
🟡Demo
🖥GitHub


@ai_machinelearning_big_data

#AI #ML #MMLM #Audio #AudioFlamingo #NVIDIA
  • 💯 42
  • 🔥 37
  • 👍 11
  • 👏 9
  • 🤓 7
  • ❤ 6
More from @ai_machinelearning_big_data
  1. Oct 9, 2026✔️ OpenAI начала развёртывание GPT-6 с динамическим интерфейсом Главное новшество – систем…
  2. Oct 9, 2026📌 Кейноут Windows and Surface event На осенней презентации 7 октября Microsoft рассказала…
  3. Oct 9, 2026✔️ Meta*, DeepMind и Isomorphic Labs присоединились к проекту симуляции живых клеток Неком…
  4. Oct 8, 2026✔️ Организатора схемы накрутки ИИ-музыки приговорили к 18 месяцам тюрьмы Федеральный суд С…
  5. Oct 8, 2026📌Baseten выпустила бесплатный учебник по инженерии инференса Платформа, которая хостит мо…
  6. Oct 8, 2026✔️ Anthropic даёт стартапам год Claude Team и 1000 долларов на API Программу Claude for St…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →