TGViewer
هوش مصنوعی و علم داده به فارسی هوش مصنوعی و علم داده به فارسی @dataplusscience · 6.06K subscribers
Post #3746 142
‏🌐 انتشار Olmo-core 3 برای آموزش مدل‌های MoE

‏موسسه Ai2 از Olmo-core 3 رونمایی کرد؛ مجموعه‌ای از ابزارهای متن‌باز که برای آموزش مدل‌های Mixture-of-Experts (MoE) با مقیاس یک تریلیون پارامتر بهینه‌سازی شده است. این زیرساخت، جایگزین FSDP شده و از ترکیب expert parallelism، pipeline parallelism و یک بهینه‌ساز توزیع‌شده برای مدیریت بهتر پارامترها روی GPU استفاده می‌کند.

‏عملکرد این سیستم در اجرای مدل‌های MoE به شرح زیر است:

‏- مدل 47 میلیارد پارامتری روی 8 کارت گرافیک B300 به سرعت 52 هزار توکن در ثانیه بر هر GPU رسیده که 2.7 برابر سریع‌تر از نسخه قبل است.
‏- با استفاده از فرمت داده‌ای MXFP8، سرعت نسبت به BF16 حدود 21 درصد افزایش می‌یابد.
‏- افزایش تعداد متخصص‌ها از 8 به 128، کمتر از 5 درصد افت در کارایی (throughput) ایجاد می‌کند.
‏- بزرگ‌ترین تست انجام‌شده شامل یک مدل 1.2 تریلیون پارامتری روی 512 کارت B300 بوده که به نرخ 858 TFLOP/s بر هر GPU دست یافته است.

‏کد این پروژه تحت لایسنس Apache 2.0 منتشر شده است.

🇮🇷 - هوش مصنوعی و علم داده به فارسی
🌐 سایت | تلگرام | بله | ایتا | ارتباط با ما
More from @dataplusscience
  1. Oct 2, 2026‏🧩 شتاب‌دهی به پژوهش‌های علمی با Claude ‏آنتروپیک در گزارش جدید خود توضیح داده اس…
  2. Oct 2, 2026‏🤖 عرضه نسخه جدید Kling 4.0 با قابلیت‌های پیشرفته ویدئویی ‏مدل هوش مصنوعی Kling 4…
  3. Oct 2, 2026‏🤖 انتشار مدل‌های تصمیم‌گیری Clef توسط Cloudflare ‏کلودفلر از مدل‌های وزن‌باز Cle…
  4. Oct 2, 2026‏🎨 عرضه مدل تصویرساز FLUX.1 توسط Black Forest Labs ‏شرکت Black Forest Labs مدل جد…
  5. Oct 2, 2026‏📊 انتشار مجموعه داده Ego-Exo4D-HM برای بازسازی حرکت انسان ‏دانشگاه تگزاس در آستی…
  6. Oct 2, 2026‏🧠 تأثیر ایجنت‌های هوش مصنوعی بر اقتصاد اشتراکی ‏تحقیقات استنفورد نشان می‌دهد حدو…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →