TGViewer
ИИ пашет, Саша одобряет ИИ пашет, Саша одобряет @defendend_ai_dev · 658 subscribers
Post #43 479

Forwarded from LLM под капотом

LLM Бенчмарк Anthropic Fable 5 на бизнес-задачах

c максимальным reasoning

Если кратко, то эта новая модель считает себя слишком умной и на задачах, которые требуют точных ответов, иногда начинает нести больше отсебятины, нежели другие frontier модели. Из-за этого у нее такая просадка в Software Engineering задачах. По итогу она заняла вполне себе достойное десятое место.

Правда, если сравнивать стоимость с другими моделями в TOP-10, то можно найти модели подешевле и поумнее для внедрений в бизнес.

Задачи на бенчмарке собраны из тестов и evals, которые мы собрали во время работы над внедрениями LLM в бизнес в корпорациях и стартапах в США и Европе.

Про бенчмарки подробнее написано тут, включая ответы на все те вопросы, которые задавали люди первую пару лет публикации этого бенчмарка. Полная версия бенчмарка за Июнь 2026 - тут.

За LLM бенчмарк теперь отвечает @AigizK, поэтому если интересует какая-то популярная модель (вроде xiaomi/mimo-v2.5-pro, что была под капотом у TOP-20 ECOM1 агента), то это уже обращаться к нему.

Ваш, @llm _under_hood 🤗
  • 🔥 4
  • 😁 1
More from @defendend_ai_dev
  1. Sep 23, 2026photo post
  2. Sep 23, 2026еще и на опус, не помню чтобы хоть раз антропики давали такой, кнопочный
  3. Sep 22, 2026а вот и ресет подарили
  4. Sep 22, 2026👆👆👆 Не много про будни от Лехи, а так в общем попробовал уже opus 5.5, самое замечатель…
  5. Sep 22, 2026Еще немного будней разработчиков агентов Представьте у вас полно агентов в разных странах.…
  6. Sep 22, 2026Новый бенч подвезли
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →