Вопросы с собеседований по Python
@workakkk - админ
@machinelearning_interview - вопросы с собесдований по Ml
@pro_python_code - Python
@data_analysis_ml - анализ данных на Python
@itchannels_telegram - 🔥 главное в ит
РКН: clck.ru/3FmrFd
Post #1423
2.44K

🚀 Tencent выкатывает Covo-Audio (7B) - новый уровень голосовых AI.
Это уже не просто “распознал → ответил → озвучил”.
Модель умеет говорить и слушать одновременно.
Что внутри:
• Qwen2.5-7B + Whisper
• 8 млн часов аудио обучения
• full-duplex — диалог без пауз
Главное отличие:
Нет отдельных пайплайнов ASR и TTS.
→ всё работает как единая модель
Что это даёт:
• можно перебивать (barge-in)
• естественный разговор, как с человеком
• меньше задержек
• меньше костылей в архитектуре
Отдельно:
Разделение интеллекта и голоса
→ проще делать voice cloning
→ гибкость под разные сценарии
Тренд очевиден:
AI переходит от “голосовых интерфейсов”
→ к полноценному живому диалогу
Скоро кнопка “нажми и говори” исчезнет совсем.
Модель: https://huggingface.co/tencent/Covo-Audio-Chat
Это уже не просто “распознал → ответил → озвучил”.
Модель умеет говорить и слушать одновременно.
Что внутри:
• Qwen2.5-7B + Whisper
• 8 млн часов аудио обучения
• full-duplex — диалог без пауз
Главное отличие:
Нет отдельных пайплайнов ASR и TTS.
→ всё работает как единая модель
Что это даёт:
• можно перебивать (barge-in)
• естественный разговор, как с человеком
• меньше задержек
• меньше костылей в архитектуре
Отдельно:
Разделение интеллекта и голоса
→ проще делать voice cloning
→ гибкость под разные сценарии
Тренд очевиден:
AI переходит от “голосовых интерфейсов”
→ к полноценному живому диалогу
Скоро кнопка “нажми и говори” исчезнет совсем.
Модель: https://huggingface.co/tencent/Covo-Audio-Chat
- ❤ 2
- 🔥 2










