Anthropic випустила Claude Fable 5.1 — і на окремих задачах приріст дуже великий
Anthropic представила одразу дві моделі:
Claude Fable 5.1 — загальнодоступну
і Claude Mythos 5.1 — версію для перевірених організацій із розширеними можливостями в кібербезпеці та біології.
https://www.anthropic.com/claude-fable-and-mythos-5-1
По суті це одна базова модель, але з різними рівнями safeguards.
І в бенчмарках Fable 5.1 справді сильно відірвалася від попередньої версії.
Наприклад:
Agentic scientific research
Fable 5.1 — 52,6%
Fable 5 — 24,7%
GPT-5.6 Sol — 22,4%
Тут результат нової моделі більш ніж удвічі вищий за Fable 5.
Agentic coding / Terminal-Bench 4.0
Fable 5.1 — 55,8%
Fable 5 — 42,0%
Opus 5 — 52,3%
GPT-5.6 Sol — 37,3%
А Mythos 5.1 у цьому ж тесті набрала 60,9%.
Business workflows / AutomationBench
Fable 5.1 — 31,4%
Fable 5 — 17,1%
Opus 5 — 26,9%
GPT-5.6 Sol — 19,6%.
CursorBench 3.2
Fable 5.1 — 73,4%
Fable 5 — 70,5%
Opus 5 — 70,0%
GPT-5.6 Sol — 67,2%.
Тобто найбільший стрибок — не просто в «розумності», а саме в довгих агентних задачах.
Модель краще:
— працює годинами без постійного контролю;
— не губить контекст у довгих workflow;
— сама перевіряє свою роботу;
— відновлюється після помилок;
— може вести великі coding-проєкти від початку до кінця.
І Anthropic дуже багато уваги приділяє саме цьому. #Claude #Anthropic #Fable51 #AIagents #ClaudeCode #coding #AI #GPT56 #automation
Post #483
90