Лучшую модель для распознавания речи дропнули в опенсорс — спецы из NVIDIA выкатили Nemotron 3 Diarization.
Она разбирает голоса даже в дорожках, где люди спорят друг с другом, и умеет определять, кто и когда говорит.
Всего модель для диаризации поддерживает разговоры до 8️⃣ участников. Это лучшие показатели по бенчам среди всех моделей такого типа: доля ошибок 14% — на 24% ниже ближайшего конкурента.
Модель всего на 100 млн параметров и много мощностей не требует. Ну и да:
🔤🔤🔤🔤🔤🔤🔤🔤🔤
Тестим демо тут.
🙂 Не баг, а фича
Post #28025
17.8K
- ❤ 32
- 👍 13
- 🔥 5
- 😁 4