🎙️ VibeVoice-Realtime-0.5B: реал-тайм TTS от Microsoft, маленькая, крутая, но только на английском
Microsoft Research открыл новую лёгкую модель для синтеза речи в реальном времени. VibeVoice-Realtime-0.5B — это минималистичная версия VibeVoice с фокусом на очень низкую латенцию (первый слышимый звук за ~300 мс, зависит от железа).
Что пригодится:
0.5B параметров
Streaming text input: модель генерирует речь по мере поступления текста (идеально для LLM-ов, которые пишут ответ словами)
Латенция ~300 мс до первого звука vs. обычные секунды
Один спикер (для multi-speaker — используйте 1.5B версию)
Может генерировать ~10 минут речи одновременно
Бенчмарки: WER 2.00% (Voicebox — 1.90%), speaker similarity 0.695
Технически интересно: Использует diffusion-based подход (DDPM), работает с акустическим токенайзером на 7.5 Hz (суперэффективно для long-form). Базовая LLM — Qwen2.5-0.5B.
Ограничения:
Только английский
Research-only (хотя MIT лицензия технически позволяет commercial use)
В каждый аудиофайл встроен disclaimer "This segment was generated by AI" и imperceptible watermark
Кейс: Представляете — LLM на Groq генерирует ответ word-by-word, а VibeVoice начинает озвучивать с первого токена. Пользователь слышит речь почти сразу, пока LLM ещё думает. Это работает в WebSocket demo.
🔗 Ссылки:
🏠 Hugging Face модель
🐙 GitHub (инструкции по запуску)
📄 Техрепорт на arXiv
🎮 Project Page с демками
Первые впечатления: 👍 Латенция реально выглядит как прорыв для интерактивных сценариев. Размер модели — идеален. Но это research-only, и Microsoft явно осторожничает с misuse prevention. На HackerNews отметили, что инонация ещё немного робкая для production, но для 0.5B параметров — неплохо.
#ai #tts #microsoft
Post #664
31