شرکت Anthropic در اولین کنفرانس توسعهدهندگان خودش که پنجشنبه برگزار شد، از دو مدل جدید هوش مصنوعی رونمایی کرد که به گفتهی خودش، جزو بهترین مدلهای موجود در بازار هستن. با توجه به نتایجی که از بنچمارکهای مختلف منتشر شده، این ادعا تا حدی قابلتأییده.
این دو مدل با نامهای Claude Opus 4 و Claude Sonnet 4، اعضای جدید خانوادهی Claude 4 هستن. Anthropic میگه این مدلها توانایی تحلیل دادههای بزرگ، انجام وظایف پیچیده و بلندمدت، و گرفتن تصمیمهای چندمرحلهای رو دارن. همچنین به طور خاص برای انجام کارهای برنامهنویسی آموزش دیدن و برای نوشتن و ویرایش کد مناسبسازی شدن.
مدل Sonnet 4 هم برای کاربران رایگان و هم برای کاربران پولی چتبات Anthropic در دسترسه، اما دسترسی به Opus 4 فقط برای کاربران پولی فراهمه. هزینه استفاده از API این مدلها روی پلتفرمهای Amazon Bedrock و Google Vertex AI هم به این شکله: برای Opus 4، هزینهی ورودی ۱۵ دلار و خروجی ۷۵ دلار برای هر یک میلیون توکنه؛ برای Sonnet 4 هم به ترتیب ۳ و ۱۵ دلار.
بین این دو، Opus 4 مدل قدرتمندتریه و به گفتهی Anthropic میتونه تمرکز خودش رو در مسیرهای طولانی و پیچیده حفظ کنه. از طرف دیگه، Sonnet 4 که نسخهی بهروزرسانیشدهای از Sonnet 3.7 محسوب میشه، در حوزههای کدنویسی و ریاضی عملکرد بهتری از خودش نشون میده و دستورات رو با دقت بیشتری دنبال میکنه.
به گفتهی Anthropic، خانوادهی Claude 4 نسبت به نسخهی قبلی، کمتر دچار پدیدهی موسوم به reward hacking میشن؛ یعنی مدلی که برای رسیدن به جواب درست، از میانبر یا اشکالات موجود در دستور استفاده میکنه.
در تستهای بنچمارک، Opus 4 موفق شده مدلهایی مثل Gemini 2.5 Pro از گوگل و مدلهای o3 و GPT-4.1 از OpenAI رو توی بنچمارک SWE-bench Verified شکست بده. این بنچمارک برای ارزیابی توانایی کدنویسی طراحی شده. با این حال، توی ارزیابیهای پیچیدهتر و چندوجهی مثل MMMU یا GPQA Diamond، نتونسته عملکرد بهتری نسبت به o3 داشته باشه.
مدل Opus 4 قراره با لایههای امنیتی بیشتری عرضه بشه؛ از جمله سیستمهای پیشرفته برای شناسایی محتوای مخرب. تستهای داخلی شرکت نشون داده که این مدل میتونه توانایی افراد دارای تخصص در حوزههای STEM رو برای دسترسی، ساخت یا استفاده از سلاحهای شیمیایی، بیولوژیکی یا هستهای افزایش بده. برای همین، این مدل توی طبقهبندی داخلی انتروپیک در سطح ASL-3 قرار گرفته.
به گفتهی انتروپیک، هر دو مدل Opus 4 و Sonnet 4 مدلهایی «هیبریدی» هستن، یعنی هم میتونن پاسخهای سریع بدن، هم در حالت reasoning با صرف زمان بیشتر، تحلیل عمیقتری انجام بدن. وقتی این حالت فعال باشه، مدل قبل از ارائهی پاسخ، راهحلهای مختلف رو بررسی میکنه و در نهایت، یک خلاصهی «کاربرپسند» از روند تفکر خودش نمایش میده. البته دلیل اینکه کل فرآیند تفکر نمایش داده نمیشه، حفظ مزیت رقابتی شرکت عنوان شده.
این مدلها میتونن بهطور همزمان از ابزارهایی مثل موتور جستوجو استفاده کنن و بین حالت Reasoning و ابزارهای جانبی جابهجا بشن تا کیفیت پاسخها بهتر بشه. همچنین اطلاعات مفید رو در حافظه ذخیره میکنن تا در طول زمان، عملکرد پایدارتری داشته باشن.
همچنین انتروپیک قراره ابزار Claude Code رو هم ارتقا بده. این ابزار به توسعهدهندهها اجازه میده از طریق ترمینال مستقیماً با مدلها تعامل کنن. حالا با نسخهی جدید، Claude Code به محیطهای توسعه مثل IDEها متصل میشه و یک SDK جدید هم براش منتشر شده که اجازه میده به اپلیکیشنهای دیگه متصل بشه و باهاشون کار کنه.
@aipulse24
Post #494
2.65K



- 🔥 21
- ❤ 5
- 👍 1