TGViewer
هوش مصنوعی و علم داده به فارسی هوش مصنوعی و علم داده به فارسی @dataplusscience · 6.06K subscribers
Post #3450 244
‏🚀 تحول مدل‌های صوتی با Gemini 3.8 Live

‏گوگل از مدل‌های جدید Gemini 3.8 Live و Extended Thinking رونمایی کرد که به‌طور اختصاصی برای تعاملات صوتی بی‌درنگ در محیط‌های عملیاتی طراحی شده‌اند. این مدل‌ها به جای استفاده از ترکیب مرسوم ASR، LLM و TTS، از یک ساختار یکپارچه استفاده می‌کنند.

‏ویژگی‌های کلیدی این مدل‌ها عبارتند از:
‏- حذف وقفه در گفتگو هنگام پردازش منطقی و فراخوانی ابزارها در پس‌زمینه.
‏- کسب رتبه نخست در شاخص صوتی Artificial Analysis.
‏- قابلیت سوئیچ خودکار بین ۹۷ زبان مختلف در حین مکالمه.
‏- مدل قیمت‌گذاری دقیق برای ورودی و خروجی صوتی.

‏با وجود این پیشرفت‌ها، چالش‌های مربوط به جریان‌های کاری پیچیده صوتی همچنان پابرجاست. در حال حاضر دسترسی به این مدل‌ها صرفاً از طریق API گوگل امکان‌پذیر است.


بررسی مدل‌های صوتی Gemini 3.8 Live؛ تحولی در تعاملات کلامی هوش مصنوعی

📊 Data➕Science 🇮🇷 - هوش مصنوعی و علم داده به فارسی
📩 ارتباط با ما


#Gemini_3_8_Live #Extended_Thinking
More from @dataplusscience
  1. Oct 2, 2026‏📊 انتشار مجموعه داده Ego-Exo4D-HM برای بازسازی حرکت انسان ‏دانشگاه تگزاس در آستی…
  2. Oct 2, 2026‏🧠 تأثیر ایجنت‌های هوش مصنوعی بر اقتصاد اشتراکی ‏تحقیقات استنفورد نشان می‌دهد حدو…
  3. Oct 2, 2026🧠 خلاصه تحولات 24 ساعت گذشته هوش مصنوعی و علوم داده 🗂 گزارش #131 | 📌 8 آیتم گزارش | 🧾…
  4. Oct 2, 2026‏🛠 عرضه ابزار متن‌باز MCP برای سرویس ترب ‏ابزار جدیدی برای تعامل با سرویس «ترب» ب…
  5. Oct 2, 2026‏🤖 معرفی مدل‌های Intern-Decision برای تصمیم‌گیری ساختاریافته ‏خانواده مدل‌های Int…
  6. Oct 2, 2026‏🤖 شکستن کد ۲۱۷ ساله ناپلئون با GPT-6 Astra ‏کارتر چرچ با استفاده از مدل GPT-6 As…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →