تفاوت وحشتناک این نسل با تمام مدلهای قبلی اینه که دیگه فقط یه متنخوان رباتیک نیست؛ عمق فرکانس صدا، کنترل لرزش حنجره موقع بغض، مکثهای سنگین و بازیگری خطبهخط روی دیالوگها انجام میده.
این مدل مستقیما توکنهای صوتی را در سطح هسته نورونی خود درک و رندر میکند.
به همین دلیل وزن احساسی، تمپو، لرزش تار صوتی و حتی نفس کشیدنها مستقیما با معنای واژهها گره میخورند.
این مدل میتواند متنهای طولانی را بدون افت کیفیت به پادکست صوتی تبدیل کند.
در گوگل استودیو میتونید این مدل رو تست و استفاده کنید.
برای اینکه قدرت شگفتانگیز مدل رو عمیقا تست کنید با زبان انگلیسی انجامش بدید.
پ. ن: چون با گوشی ضبط کردم نویز محیط با صدا قاطی شده.
#Gemini #TTS
@mathloopifinite