MOSS-Audio-4B-Instruct
Открытая модель понимания аудио. Понимает речь, музыку, звуки окружения, отвечает на вопросы об аудио и умеет рассуждать по шагам (chain-of-thought). Четыре варианта: 4B и 8B, Instruct и Thinking
• транскрипция речи с таймштами слов и предложений
• анализ говорящего: пол, возраст, акцент, эмоции
• описание сцены по фоновым звукам
• музыка: стиль, инструменты, эмоциональное развитие
• время-ориентированные вопросы - что произошло когда
• свой аудиоэнкодер 12.5 Гц + Qwen3 в качестве языковой базы
• DeepStack - фиче-инъекция от ранних слоев энкодера в LM
• тайм-маркеры вшиты в претрейн - модель учит хронологию
Гитхаб
HF
#alm
MAX
Post #14785
1.25K

- 👍 7