بعد از عرضه مدل های زبانی در روز گذشته، امروز علی بابا مدل Qwen2.5-Omni با ۷ میلیارد پارامتر رو بصورت متن باز منتشر کرد، مدلی جامع که میتونه متن، صدا، تصویر و ویدئو رو پردازش کنه.
از قابلیت های این مدل جامع معماری "thinker-talker" هست که امکان استدلال و صحبت کردن رو به طور همزمان فراهم میکنه.
متفکر (Thinker): مانند مغز عمل میکنه. ورودی های مختلف (متن، صدا، تصویر) رو پردازش و درک می کنه، اطلاعات مهم رو استخراج و به صورت متن آماده می کنه
گوینده (Talker): مانند دهان انسان عمل می کنه، متن تولید شده توسط متفکر رو به صورت پیوسته دریافت و اونها رو به صورت کلمات گسسته به زبان میاره
در طول آموزش و استفاده، گوینده مستقیما اطلاعات مهم تولید شده توسط متفکر رو دریافت و تمام اطلاعات قبلی متفکر رو نیز به اشتراک می گذاره. در نتیجه، کل معماری به عنوان یک مدل واحد و یکپارچه عمل میکنه و امکان آموزش و استفاده end-to-end رو فراهم می کنه
جزییات معماری:
https://qwenlm.github.io/blog/qwen2.5-omni/
دمو:
https://chat.qwenlm.ai/
Post #3982
6.16K