🔍 گوگل دو مدل جدید Gemini 3.8 Flash TTS و Gemini 3.8 Flash-Lite TTS رو معرفی کرده؛ مدلهایی برای تبدیل متن به صدا که فقط متن رو نمیخونن و امکان کنترل نحوه صحبت کردن و ساخت صداهای سفارشی رو هم فراهم میکنن.
با Flash TTS میتونید یک صدای کاملاً جدید رو با توضیح متنی طراحی کنید؛ مثلاً ویژگیهایی مثل نقش، لهجه و خصوصیات صدا رو مشخص کنید. علاوه بر این، میشه یک صدا رو از روی نمونه صوتی حدود ۳۰ ثانیهای بازسازی کرد، البته برای صدای فرد دیگه باید رضایت صوتی صاحب صدا ارائه بشه.
بعد از انتخاب صدا هم کنترل زیادی روی نحوه اجرا دارید. میتونید برای هر بخش از متن، سرعت، لحن، حالت بیان و حتی واکنشهایی مثل خنده، آه یا نفسکشیدن رو مشخص کنید. برای گفتوگوهای دونفره هم میشه دو صدای متفاوت تعریف کرد و مدل میتونه در محتوای طولانی، ثبات صدای شخصیتها رو بهتر حفظ کنه.
در کنار این مدل، Flash-Lite TTS برای زمانی ساخته شده که سرعت و تولید حجم زیادی صدا اهمیت بیشتری داره؛ مثلاً برای دوبله تعداد زیادی محتوا، قابلیت خواندن متن یا ساخت پاسخهای صوتی برای دستیارها. این مدل هم از کنترل نحوه بیان و ساخت صدای سفارشی پشتیبانی میکنه و برای استفادههای پرتعداد و کمهزینهتر بهینه شده.
🌎 از نظر دسترسی، Flash TTS برای کاربران در Gemini Notebook و Flash-Lite TTS در Google Vids ارائه شده. هر دو مدل هم برای توسعهدهندهها از طریق Google AI Studio و Gemini API در دسترس هستن.