🔈 گوگل با معرفی رویکرد جدید «Speech-to-Retrieval (S2R)» مرزهای جستوجوی صوتی را جابهجا کرد
گوگل در تازهترین پژوهش خود، رویکردی نو به نام S2R (گفتار به بازیابی) معرفی کرده که مرحلهی تبدیل گفتار به متن (ASR) را کاملاً حذف میکند. در این روش، پرسوجوی گفتاری کاربر مستقیماً به یک بردار تعبیه صوتی (audio embedding) تبدیل میشود و سپس برای بازیابی اطلاعات به بردارهای اسناد تطبیق داده میشود.
🔺 نوآوری کلیدی:
در مدلهای قدیمی، مسیر جستوجو بهصورت زنجیرهای بود: گفتار 👈 متن 👈 بازیابی.
اما در S2R، گوگل از یک سیستم رمزگذار دوگانه (dual-encoder) استفاده کرده که مرحلهی متن را دور میزند و مستقیماً بین گفتار و اطلاعات پیوند برقرار میکند.
🌍 کاربرد در مقیاس جهانی:
این فناوری هماکنون در Voice Search چندزبانهی گوگل بهکار گرفته شده و ارزیابیها نشان میدهد که S2R از مدلهای کلاسیک مبتنی بر متن عملکرد بهتری دارد — حتی نزدیک به نتایجی که بر پایهی رونویسی انسانی تأییدشده بهدست میآیند.
📚 استانداردسازی پژوهش:
برای تسهیل پژوهش در این حوزه، گوگل دیتاست جدیدی به نام Simple Voice Questions (SVQ) را منتشر کرده که شامل ۱۷ زبان و ۲۶ ناحیهی زبانی است و بخشی از چارچوب Massive Sound Embedding Benchmark (MSEB) محسوب میشود.
🔗 تحلیل کامل:
MarkTechPost
🔬 جزئیات فنی:
Google Research Blog
👾 هوگر ؛ استودیوی توسعه محصولات و خدمات هوش مصنوعی
@hoogerstudio
Post #104
153