🚀 Step-Audio-R1 — первый аудио-LLM, который открыл масштабирование вычислений на этапе инференса для задач звука. Новый рубеж для моделей, работающих с живым аудио.
🛠️ Ключевые возможности:
- глубокое понимание аудиосигнала
- реакция в реальном времени
- масштабируемые цепочки рассуждений для аудио-задач
🔥 Производительность:
- превосходит Gemini 2.5 Pro и сопоставим с Gemini 3 на ключевых бенчмарках по аудио-reasoning
- 96% точности в режиме реального времени - выше, чем GPT Realtime и Gemini 2.5 Flash Native Audio Dialog
- латентность первого токена - всего 0.92 секунды
Step-Audio-R1 использует Modality-Grounded Reasoning Distillation (MGRD) - подход, при котором цепочки рассуждений привязываются не к "домыслам модели", а к реальным акустическим признакам сигнала.
То есть модель рассуждает, опираясь на звук, а не на абстракции из текста.
Это убирает галлюцинации, повышает надёжность и позволяет масштабировать глубину reasoning так же, как это делают текстовые R1-подобные модели, но теперь в аудио.
Новый этап: LLM, которые думают не только над текстом, но и над реальным звучанием мира.
👾Demo: https://stepaudiollm.github.io/step-audio-r1/
📄 Paper: https://arxiv.org/abs/2511.15848
🐙 GitHub: https://github.com/stepfun-ai/Step-Audio-R1
Post #2376
3.99K


- ❤ 9
- 👍 6
- 🔥 5