داشتم مقاله معرفی Claude Opus 4.8 از Anthropic رو میخوندم و حس کردم کمکم داریم وارد فاز جدیدی از مدلهای AI میشیم. جایی که صرفاً باهوشتر بودن مهم نیست، بلکه اینکه مدل چقدر قابل اعتماده اهمیت بیشتری پیدا کرده. چیزی که توی این نسخه خیلی روش تاکید شده اینه که Claude کمتر وقتها الکی با اعتمادبهنفس جواب اشتباه میده و وقتی مطمئن نیست، راحتتر عدم قطعیت رو نشون میده. شاید ساده به نظر بیاد ولی به نظرم دقیقاً همین فرق بین یه مدل نمایشی و یه مدلیه که واقعاً بشه توی کار جدی بهش تکیه کرد.
از اون طرف قابلیتهای agenticش هم خیلی خفن شده. مدل میتونه برای تسکهای پیچیده چندتا workflow موازی اجرا کنه، خروجیها رو بررسی کنه و بعد جمعبندی نهایی بده. یعنی کمکم داریم از «چتبات» فاصله میگیریم و میرسیم به چیزی شبیه همکار واقعی.
حسی که از کل مقاله گرفتم این بود که رقابت اصلی AI دیگه فقط روی benchmark و عدد و رقم نیست؛ روی اعتماد کاربره. هر مدلی که کمتر hallucinate کنه و رفتار قابلپیشبینیتری داشته باشه، احتمالاً برندهی نسل بعدیه.
#Opus_48
https://www.anthropic.com/news/claude-opus-4-8
@codehalics | کدهالیک
Post #697
829

- 👍 3
- ❤ 1