متا از مدل بزرگ زبانی خود رونمایی کرد
متا مدل بزرگ زبانی خودش، LLaMA را به صورت Open Source به اشتراک گذاشت.
مدل LLaMA در واقع مجموعهای از مدلهای زبان پایه است که پارامترهای آن از 7B تا 65B متغیر است.
این مدلها بر روی تریلیونها توکن آموزش داده شده است و نشان میدهد که آموزش مدلهای پیشرفته فقط با استفاده از مجموعه دادههای در دسترس عموم امکانپذیر است و نیازی به استقاده از دادههای اختصاصی و غیرقابل دسترس نیست.
به خصوص:
مدل LLaMA-13B در اکثر Benchmarkها بهتر از GPT-3 (175B) عمل می کند
مدل LLaMA-65B با بهترین مدل های Chinchilla70B و PaLM-540B قابل رقابت است.
برای خواندن مقاله روی متن کلیک کنید.
برای خواندن بلاگ روی متن کلیک کنید.
لینک گیت هاب مدل
این پست رو برای دوستان علاقه مندتون هم بفرستید
@Roboepics
Post #1568
486
Forwarded from RoboEpics
