TGViewer
CleverDevs CleverDevs @cleverdevs · 10.9K subscribers
Post #2445 8.96K

Forwarded from AI Pulse (Mohammad)

گوگل در کنفرانس دیشب از  Gemini Diffusion رونمایی کرد. یه مدل آزمایشی که به‌جای پیش‌بینی کلمه‌به‌کلمه، از تکنیک "دیفیوژن" (پخش تدریجی) برای تولید متن استفاده می‌کنه. این سیستم دقیقا مشابه چیزیه که قبلا در مدل های خانواده Mercury دیده بودیم.

برخلاف مدل‌های زبانی سنتی که متن رو کلمه‌به‌کلمه تولید می‌کنن، Gemini Diffusion از روشی الهام‌گرفته از تولید تصویر استفاده می‌کنه: اصلاح نویز طی چند مرحله.

این سیستم با یه سری نویز تصادفی شروع می‌کنه و کم‌کم اون‌ رو به بخش‌های کامل و منسجم متن تبدیل می‌کنه. این روش اجازه می‌ده در میانه‌ی مسیر، اصلاحات انجام بشه و کنترل بیشتری روی خروجی داشت. به گفته‌ی دیپ‌مایند، این کار باعث می‌شه خروجی‌ها منسجم‌تر و از نظر منطقی، مرتبط‌تر باشن؛ چیزی که مخصوصاً برای کارهایی مثل تولید کد و ویرایش متن خیلی مؤثره، چون دقت، انسجام و امکان بازبینی تو این حوزه‌ها خیلی مهمه.


‏Gemini Diffusion به‌جای اینکه متن رو از چپ به راست و به‌صورت خطی تولید کنه، یک‌باره بخش‌های کامل از متن رو تولید می‌کنه — و این کار رو خیلی سریع‌تر از مدل‌های سنتی انجام می‌ده. دیپ‌مایند گفته این سیستم می‌تونه با سرعت ۱۴۷۹ توکن بر ثانیه (بدون احتساب سربار سیستم) کار کنه و تأخیر اولیه‌ی اون فقط ۰.۸۴ ثانیه‌ست.

به‌گفته‌ی «برندن اوداناهیو»، پژوهشگر دیپ‌مایند، این مدل توی کارهای برنامه‌نویسی حتی می‌تونه به سرعت ۲۰۰۰ توکن در ثانیه هم برسه، حتی وقتی سربارهایی مثل توکنیزیشن، آماده‌سازی و بررسی‌های ایمنی رو هم در نظر بگیریم.

«اوریول وینیالز»، معاون پژوهش دیپ‌مایند و یکی از مدیران پروژه Gemini، عرضه‌ی این مدل جدید رو یه دستاورد شخصی توصیف کرده و گفته: «همیشه آرزو داشتم بتونم نیاز به تولید متن از چپ به راست رو حذف کنم.» توی نسخه‌ی نمایشی مدل، سرعت خروجی اون‌قدری بالا بوده که برای دیدن عملکردش، مجبور شدن ویدیو رو آهسته پخش کنن.

در آزمون‌ها، Gemini Diffusion عملکردی تقریباً برابر با نسخه‌ی Gemini 2.0 Flash Lite داشته. توی وظایف برنامه‌نویسی مثل HumanEval (با دقت ۸۹.۶٪ در مقابل ۹۰.۲٪) و MBPP (۷۶٪ در مقابل ۷۵.۸٪) نتایج تقریباً مساوی بوده.

حتی توی برخی آزمون‌ها مثل LiveCodeBench (۳۰.۹٪ در مقابل ۲۸.۵٪) و LBPP (۵۶.۸٪ در مقابل ۵۶٪)، Gemini Diffusion کمی بهتر ظاهر شده. با این حال، توی حوزه‌هایی مثل استدلال علمی (GPQA Diamond) و آزمون چندزبانه‌ی Global MMLU Lite ضعیف‌تر عمل کرده و به‌ترتیب امتیازهای ۴۰.۴٪ و ۶۹.۱٪ رو گرفته، در حالی که مدل Flash Lite امتیازهای بالاتری به‌دست آورده (۵۶.۵٪ و ۷۹٪).

به این ترتیب، برای اولین‌بار یه مدل زبانی مبتنی بر تکنیک دیفیوژن تونسته به سطح عملکرد مدل‌های رایج فعلی برسه — حتی با وجود اینکه Gemini 2.0 Flash-Lite یه مدل اقتصادی‌تر و قدیمی‌تر از گوگله.

«جک ری»، دانشمند ارشد دیپ‌مایند، این دستاورد رو یه «لحظه‌ی تاریخی» دونسته. تا پیش از این، مدل‌های خودبازگشتی (autoregressive) همیشه توی کیفیت متن عملکرد بهتری داشتن و مشخص نبود که مدل‌های دیفیوشن بتونن بهشون برسن. ری این موفقیت رو نتیجه‌ی تحقیقات متمرکز و حل «تعداد زیادی» از چالش‌های فنی دونسته.

@aipulse24
  • 🔥 22
  • 👍 12
  • ❤ 3
  • 💯 1
More from @cleverdevs
  1. Sep 24, 2026شرکت کوالکام اعلام کرده قرار هست پشتیبانی رسمی لپتاپهای مجهز به چیپ Snapdragon X2 از لینوک…
  2. Sep 23, 2026توی کدای کرنل برای سیستم‌کال reboot شما باید دوتا magic value به تابع بدید تا کرنل برای ای…
  3. Sep 21, 2026یه نفر اومده و یه موزیک پلیر لینوکس به اسم sung با cpp و qt نوشته که طراحی زیبا و ویژگی ها…
  4. Sep 18, 2026خب اومدم یک پست شبانه بذارم و برم تا چند روز دیگه که با یک محتوای خوب برگردم :3 براتون سوا…
  5. Sep 14, 2026بیرجند لاگی ها توی روز برنامه نویس یه چلنج باحال دیگه داشتن: چلنج فشرده سازی! (: توی این ر…
  6. Sep 13, 2026روزتون مبارک https://en.wikipedia.org/wiki/Programmer%27s_Day @CleverDevs - @CleverDevsGp
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →