موسسه Ai2 از Olmo-core 3 رونمایی کرد؛ مجموعهای از ابزارهای متنباز که برای آموزش مدلهای Mixture-of-Experts (MoE) با مقیاس یک تریلیون پارامتر بهینهسازی شده است. این زیرساخت، جایگزین FSDP شده و از ترکیب expert parallelism، pipeline parallelism و یک بهینهساز توزیعشده برای مدیریت بهتر پارامترها روی GPU استفاده میکند.
عملکرد این سیستم در اجرای مدلهای MoE به شرح زیر است:
- مدل 47 میلیارد پارامتری روی 8 کارت گرافیک B300 به سرعت 52 هزار توکن در ثانیه بر هر GPU رسیده که 2.7 برابر سریعتر از نسخه قبل است.
- با استفاده از فرمت دادهای MXFP8، سرعت نسبت به BF16 حدود 21 درصد افزایش مییابد.
- افزایش تعداد متخصصها از 8 به 128، کمتر از 5 درصد افت در کارایی (throughput) ایجاد میکند.
- بزرگترین تست انجامشده شامل یک مدل 1.2 تریلیون پارامتری روی 512 کارت B300 بوده که به نرخ 858 TFLOP/s بر هر GPU دست یافته است.
کد این پروژه تحت لایسنس Apache 2.0 منتشر شده است.
🇮🇷 - هوش مصنوعی و علم داده به فارسی
🌐 سایت | تلگرام | بله | ایتا | ارتباط با ما
