گوگل از مدلهای جدید Gemini 3.8 Live و Extended Thinking رونمایی کرد که بهطور اختصاصی برای تعاملات صوتی بیدرنگ در محیطهای عملیاتی طراحی شدهاند. این مدلها به جای استفاده از ترکیب مرسوم ASR، LLM و TTS، از یک ساختار یکپارچه استفاده میکنند.
ویژگیهای کلیدی این مدلها عبارتند از:
- حذف وقفه در گفتگو هنگام پردازش منطقی و فراخوانی ابزارها در پسزمینه.
- کسب رتبه نخست در شاخص صوتی Artificial Analysis.
- قابلیت سوئیچ خودکار بین ۹۷ زبان مختلف در حین مکالمه.
- مدل قیمتگذاری دقیق برای ورودی و خروجی صوتی.
با وجود این پیشرفتها، چالشهای مربوط به جریانهای کاری پیچیده صوتی همچنان پابرجاست. در حال حاضر دسترسی به این مدلها صرفاً از طریق API گوگل امکانپذیر است.
بررسی مدلهای صوتی Gemini 3.8 Live؛ تحولی در تعاملات کلامی هوش مصنوعی
📊 Data➕Science 🇮🇷 - هوش مصنوعی و علم داده به فارسی
📩 ارتباط با ما
#Gemini_3_8_Live #Extended_Thinking
