MOSS-TTS: открытый голос для ИИ-агентов
OpenMOSS и MOSI.AI выложили MOSS-TTS под Apache-2.0. Это семейство открытых моделей для речи и звука.
Если совсем по-человечески: MOSS-TTS превращает текст в голос, умеет клонировать голос по примеру, делать диалоги с несколькими говорящими и генерировать звуковые эффекты.
Вместо одной «говорилки» здесь целый набор моделей под разные аудио-задачи.
Проект уже заметили: 3600 звёзд и 314 форков на GitHub.
Что внутри:
┈ MOSS-TTS-v1.5: большая 8B модель для многоязычной речи, клонирования голоса и управления паузами
┈ MOSS-TTS-Local-Transformer-v1.5: 4B версия на Qwen3-4B и MOSS-Audio-Tokenizer-v2
┈ MOSS-SoundEffect-v2.0: модель для звуковых эффектов до 30 секунд
┈ MOSS-TTS-Nano: маленькая версия около 100M параметров, которая умеет стримить речь на 4 CPU cores
Почему это важно: голосовые агенты больше не обязаны зависеть только от закрытых TTS-сервисов. Можно взять открытую модель, поднять её у себя и встроить голос в продукт, бота, интерфейс или персонажа.
Команда уже собирает вокруг MOSS-TTS нормальную инфраструктуру: Hugging Face, ModelScope, API-доки, OpenClaw skills, vLLM-Omni, SGLang-Omni и OpenAI-compatible `/v1/audio/speech` endpoint.
Минимальная конфигурация для запуска генерации голоса:
┈ Python 3.12 и ffmpeg
┈ GPU не обязателен: есть `cpu-only.yaml` для запуска без видеокарты
┈ если есть слабая GPU-машина, есть профиль `trt-8gb.yaml` под 8 GB VRAM
┈ самый лёгкий вариант — MOSS-TTS-Nano: streaming output на 4 CPU cores
┈ обычный локальный старт идёт через GGUF Q4_K_M backbone, ONNX audio tokenizer и llama.cpp
Для пользователя это значит: голос для ИИ-агента постепенно становится такой же частью открытого стека, как модель, память и инструменты.
Источник: GitHub / OpenMOSS MOSS-TTS
🧩📣🔥💡🪄
Кейсы и инструменты: @human20
Среда ИИ: human20.app
Post #343
356

- ❤ 5