TGViewer
AI Pulse AI Pulse @aipulse24 · 3.33K subscribers
Post #490 19.8K
گوگل در کنفرانس دیشب از  Gemini Diffusion رونمایی کرد. یه مدل آزمایشی که به‌جای پیش‌بینی کلمه‌به‌کلمه، از تکنیک "دیفیوژن" (پخش تدریجی) برای تولید متن استفاده می‌کنه. این سیستم دقیقا مشابه چیزیه که قبلا در مدل های خانواده Mercury دیده بودیم.

برخلاف مدل‌های زبانی سنتی که متن رو کلمه‌به‌کلمه تولید می‌کنن، Gemini Diffusion از روشی الهام‌گرفته از تولید تصویر استفاده می‌کنه: اصلاح نویز طی چند مرحله.

این سیستم با یه سری نویز تصادفی شروع می‌کنه و کم‌کم اون‌ رو به بخش‌های کامل و منسجم متن تبدیل می‌کنه. این روش اجازه می‌ده در میانه‌ی مسیر، اصلاحات انجام بشه و کنترل بیشتری روی خروجی داشت. به گفته‌ی دیپ‌مایند، این کار باعث می‌شه خروجی‌ها منسجم‌تر و از نظر منطقی، مرتبط‌تر باشن؛ چیزی که مخصوصاً برای کارهایی مثل تولید کد و ویرایش متن خیلی مؤثره، چون دقت، انسجام و امکان بازبینی تو این حوزه‌ها خیلی مهمه.


‏Gemini Diffusion به‌جای اینکه متن رو از چپ به راست و به‌صورت خطی تولید کنه، یک‌باره بخش‌های کامل از متن رو تولید می‌کنه — و این کار رو خیلی سریع‌تر از مدل‌های سنتی انجام می‌ده. دیپ‌مایند گفته این سیستم می‌تونه با سرعت ۱۴۷۹ توکن بر ثانیه (بدون احتساب سربار سیستم) کار کنه و تأخیر اولیه‌ی اون فقط ۰.۸۴ ثانیه‌ست.

به‌گفته‌ی «برندن اوداناهیو»، پژوهشگر دیپ‌مایند، این مدل توی کارهای برنامه‌نویسی حتی می‌تونه به سرعت ۲۰۰۰ توکن در ثانیه هم برسه، حتی وقتی سربارهایی مثل توکنیزیشن، آماده‌سازی و بررسی‌های ایمنی رو هم در نظر بگیریم.

«اوریول وینیالز»، معاون پژوهش دیپ‌مایند و یکی از مدیران پروژه Gemini، عرضه‌ی این مدل جدید رو یه دستاورد شخصی توصیف کرده و گفته: «همیشه آرزو داشتم بتونم نیاز به تولید متن از چپ به راست رو حذف کنم.» توی نسخه‌ی نمایشی مدل، سرعت خروجی اون‌قدری بالا بوده که برای دیدن عملکردش، مجبور شدن ویدیو رو آهسته پخش کنن.

در آزمون‌ها، Gemini Diffusion عملکردی تقریباً برابر با نسخه‌ی Gemini 2.0 Flash Lite داشته. توی وظایف برنامه‌نویسی مثل HumanEval (با دقت ۸۹.۶٪ در مقابل ۹۰.۲٪) و MBPP (۷۶٪ در مقابل ۷۵.۸٪) نتایج تقریباً مساوی بوده.

حتی توی برخی آزمون‌ها مثل LiveCodeBench (۳۰.۹٪ در مقابل ۲۸.۵٪) و LBPP (۵۶.۸٪ در مقابل ۵۶٪)، Gemini Diffusion کمی بهتر ظاهر شده. با این حال، توی حوزه‌هایی مثل استدلال علمی (GPQA Diamond) و آزمون چندزبانه‌ی Global MMLU Lite ضعیف‌تر عمل کرده و به‌ترتیب امتیازهای ۴۰.۴٪ و ۶۹.۱٪ رو گرفته، در حالی که مدل Flash Lite امتیازهای بالاتری به‌دست آورده (۵۶.۵٪ و ۷۹٪).

به این ترتیب، برای اولین‌بار یه مدل زبانی مبتنی بر تکنیک دیفیوژن تونسته به سطح عملکرد مدل‌های رایج فعلی برسه — حتی با وجود اینکه Gemini 2.0 Flash-Lite یه مدل اقتصادی‌تر و قدیمی‌تر از گوگله.

«جک ری»، دانشمند ارشد دیپ‌مایند، این دستاورد رو یه «لحظه‌ی تاریخی» دونسته. تا پیش از این، مدل‌های خودبازگشتی (autoregressive) همیشه توی کیفیت متن عملکرد بهتری داشتن و مشخص نبود که مدل‌های دیفیوژن بتونن بهشون برسن. ری این موفقیت رو نتیجه‌ی تحقیقات متمرکز و حل «تعداد زیادی» از چالش‌های فنی دونسته.

@aipulse24
  • 👍 26
  • ❤ 6
  • 🔥 4
  • ❤‍🔥 1
More from @aipulse24
  1. Dec 28, 2025امار امسال کانال با تشکر ویژه از اسپانسر اصلی ما کانال تک تیوب:)) و محمد با پست های فوق ال…
  2. Dec 21, 2025کافیه 🎁 رو توی یک چت جدید توی ChatGPT وارد کنید (بدون هیچ متنی) تا به صورت اتوماتیک بعد ا…
  3. Dec 11, 2025گوگل به‌تازگی از یک مرورگر آزمایشی و متفاوت به نام «دیسکو» (Disco) رونمایی کرده که قرار نی…
  4. Nov 27, 2025بلک فارست لبز به تازگی از خانواده جدید مدل‌های تصویرساز خودش یعنی Flux 2 رونمایی کرده که پ…
  5. Nov 20, 2025تصویر ساخته شده توسط یکی از اعضای کانال. تکست رندرینگ و consistency مدل شگفت انگیزه. @aipu…
  6. Nov 20, 2025مدل جدید Nano Banana Pro به گوگل اسلایدز هم رسیده و الان میتونید ازش بخواید تا اسلاید هاتو…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →