گوگل در بهروزرسانی جدید مدل Gemini 3.8 Live، قابلیت تولید ویدئوی لحظهای از یک شخصیت سخنگو را اضافه کرد. این آواتار با تشخیص صوت و تصویر کاربر، به صورت خودکار حرکت لبها و میمیک چهره را با محتوای کلام هماهنگ میکند. برای توضیح فنی کاملتر این موضوع، توضیح کاملتر در سایت را ببینید.
مهمترین ویژگیهای این قابلیت:
* هماهنگی زبانی: حرکات چهره و لبها برای ۹۷ زبان مختلف بهینه شده و هنگام تغییر زبان در حین گفتگو، کیفیت تصویر حفظ میشود.
* شخصیسازی: امکان انتخاب از کتابخانه پیشفرض یا ساخت آواتار اختصاصی با استفاده از یک تصویر واحد (در حال حاضر برای مشتریان سازمانی).
* امنیت: تمام خروجیهای ویدئویی و صوتی با واترمارک غیرقابل مشاهده
SynthID نشانهگذاری میشوند.* عملکرد چندگانه: مدل میتواند همزمان دادههای ویدئویی و صوتی را دریافت کرده و ابزارهای خارجی را بدون وقفه در مکالمه فراخوانی کند.
این سرویس هماکنون از طریق
Gemini Enterprise و Gemini Live API در دسترس است.
