شرکت OpenAI مدل GPT-Live-1 را برای استفاده در API منتشر کرد. این مدل با معماری Full-Duplex طراحی شده است و میتواند به صورت همزمان گوش دهد و صحبت کند.
ویژگیهای کلیدی این مدل عبارتند از:
• تعامل کاملاً طبیعی: کاربر میتواند در هر لحظه صحبت را قطع کند یا مسیر گفتگو را تغییر دهد.
• معماری دو لایه: جداسازی مکالمه سریع از استدلال سنگین؛ مدل مدیریت گفتگو میتواند پردازشهای پیچیده را به مدلهای قدرتمندتری مانند GPT-6 Astra بسپارد.
• بهبود عملکرد: پایداری بیشتر در مواجهه با نویز محیط و مکثهای کلامی.
• ارتقای ارزیابی: کسب امتیاز ۳۰ واحد درصد بالاتر در بنچمارک Full Duplex نسبت به نسخه قبلی.
این معماری گامی بزرگ برای ساخت Voice Agentهای هوشمند است که میتوانند تجربهای نزدیک به مکالمه با انسان را ارائه دهند. هزینه لایه صوتی این مدل ۰.۰۵ دلار به ازای هر دقیقه تعیین شده است.
📊 Data➕Science 🇮🇷 - هوش مصنوعی و علم داده به فارسی
📩 ارتباط با ما
#GPTLive1 #FullDuplex