Audio-Visual Efficient Conformer for Robust Speech Recognition
Улучшенный метод чтения по губам, с помощью архитектуры Conformer Connectionist Temporal Classification (CTC) для обработки аудио и видео.
🖥 Github https://github.com/burchim/avec
✔️ Paper https://arxiv.org/abs/2301.01456
🔥Notebook https://colab.research.google.com/github/burchim/AVEC/blob/master/demo.ipynb
🚀 Models https://github.com/burchim/avec#Models
👉 @bigdata_1
Post #902
964
- 👍 3