کمپانی Anthropic با ویدئو ریلز بالا دو مدل جدید معرفی کرد: Claude Fable 5.1 و Claude Mythos 5.1
اما در این پست قصد داریم به نتایج چشمگیری که Fable 5.1 در benchmarkها ثبت کرده، بپردازیم؛ مدلی که بهنظر میرسد Anthropic آن را مشخصاً برای Agentic Coding، Research و Long-Horizon Tasks بهینه کرده است.
::: Benchmarks:
🔬 52.6% — Agentic Scientific Research
در برابر 24.7% برای Fable 5 و 29.0% برای Opus 5
یعنی Fable 5.1 در این benchmark نسبت به Fable 5 بیش از 2 برابر بهتر عمل کرده.
💻 73.4% — Agentic Coding (CursorBench 3.2.0)
در برابر 70.5% برای Fable 5 و 70.0% برای Opus 5
🧠 65.0% — Multidisciplinary Reasoning با Tool Use
در حالت بدون Tool Use هم به 60.9% رسیده.
🖥 77.9% — Computer Use (partial)
در برابر 72.9% برای Fable 5
💼 31.4% — Business Workflows
در حالی که Fable 5 در همین benchmark امتیاز 17.1% داشته است.
و از نظر هزینه:
75٪ کاهش هزینه Cache Read
و تا 45٪ کاهش هزینه در highly-agentic workloads
⚡️ اعداد نشان میدهند که مدل Fable 5 در نسخه جدید پیشرفت چشمگیری داشته است.
@Zonix_x
#anthropic #claude
Post #143
405