گوگل امروز از قابلیت مکالمه صوتی در خانواده مدلهای Gemini 2.5 رونمایی کرده. این مدلها حالا بهطور چشمگیری درک بهتری از لحن، لهجه، حالت گفتار، و حتی نجوا و خنده پیدا کردن. این یعنی شما میتونین ازش بخواین که با لحن خاصی حرف بزنه یا حتی لهجه خاصی رو تقلید کنه. مدل در حین مکالمه میتونه به ابزارهای خارجی یا اطلاعات لحظهای مثل نتایج جستوجوی گوگل دسترسی پیدا کنه و حتی صداهای مزاحم اطراف رو فیلتر کنه تا فقط وقتی که واقعاً لازمه، وارد گفتوگو بشه.
در بخش تبدیل متن به گفتار (TTS) هم Gemini 2.5 پیشرفت قابلتوجهی داشته. حالا نهتنها صدایی طبیعی تولید میکنه، بلکه میتونه بر اساس فرمانهای متنی، سبک اجرا، سرعت، احساسات و حتی شخصیت صوتی گوینده رو کنترل کنه. مثلاً میتونین ازش بخواین یه خبر رو با لحن جدی بخونه یا داستانی رو با شور و هیجان روایت کنه. این مدل حتی قادره چند صدای مختلف رو همزمان در یک مکالمه تولید کنه، که برای تولید محتوا مثل پادکست یا ویدیوهای آموزشی یه ابزار قدرتمند محسوب میشه.
پشتیبانی از بیش از ۲۴ زبان مختلف (از جمله فارسی) هم به Gemini 2.5 اجازه میده بهراحتی بین زبانها جابهجا بشه یا حتی دو زبان رو توی یک جمله ترکیب کنه. این مدل همچنین میتونه به لحن کاربر گوش بده و بر اساس احساساتی که در صدا هست، نوع پاسخ خودش رو تنظیم کنه. همه اینها باعث میشه تجربه مکالمه با Gemini طبیعیتر، انسانیتر و چندلایهتر از همیشه باشه.
گوگل اعلام کرده که در تمام مراحل توسعه این ویژگیهای صوتی، ارزیابیهای دقیق ایمنی و اخلاقی انجام داده. تمام خروجیهای صوتی این مدلها با ابزار SynthID علامتگذاری میشن تا قابل شناسایی باشن و از سواستفاده جلوگیری بشه. این قابلیتها هماکنون در Google AI Studio (بخش استریم) و Vertex AI در دسترس توسعهدهندهها قرار دارن و میتونن برای ساخت اپلیکیشنهای صوتی، داستانگو، آموزشی، یا حتی بازیهای صوتمحور ازشون استفاده کنن.
پ.ن: وقتی گفتیم «سلام»، شروع کرد اردو حرف زدن! نتیجه این شد که تصمیم گرفتیم بگیم: «درود بر شما!» :)))
در بالا ویدیویی از مکالمه فارسی با این مدل رو قرار دادیم.
@aipulse24
Post #517
3.78K
- 🤣 38
- 🔥 15
- ❤ 5
- 😁 2