TGViewer
AI-Driven Development. Родион Мостовой AI-Driven Development. Родион Мостовой @ai_driven · 5.46K subscribers
Post #259 3.45K
Аномалии Opus 5 и оптимальный reasoning effort

Если вы используете агентов так активно, что даже 200$ лимитов вам не хватает, ну или просто хотите получать адекватный результат быстрее (иногда в разы), то надо озаботиться выбором оптимального уровня размышления модели. Так вот, из официального анонса это неочевидно, а вот из системной карточки вполне.

И там видно, что в Opus 5 medium effort часто оказывается даже эффективнее, чем Fable high. При цене почти в 3 раза меньше. Видимо, теперь medium будет дефолтным выбором для пятого опуса. А во Frontier Code Opus 5 medium и вовсе показывает результаты существенно лучше, чем xhigh версия (что, конечно, подозрительно, но ОК).

Еще, в системной карточки появились мультиагентные бенчи, и один из них ProgramBench - так вот, там команда из 5-ти агентов достигает того же результат в 2.2 раза быстрее, чем одиночный агент. Привет всем любителям мультиагентных систем.
Похоже, что секцию 8.11 Multi-Agent в принципе есть смысл прочитать вдумчиво.

И любопытный факт - новенький FrontierBench v0.1 (уже третий "фронтир" све бенчмарк) они прогоняли не в родном харнессе, а в mini-SWE-agent. Результатов прогона medium effort нам почему-то в отчете не дают, только xhigh и high.

@ai_driven
  • 👍 12
  • ❤ 7
More from @ai_driven
  1. Sep 18, 2026Ребят, на всякий случай уточню для тех, кто не вчитался - по 20$ подписке до 10 октября Де…
  2. Sep 18, 2026Post #293
  3. Sep 18, 2026Вижу, что кейс с модерацией через Jev актуален, поэтому публикую пример реализации такого…
  4. Sep 18, 2026Юзкейсы Jev: улучшение RAG, Browser Use, ... Вы, наверное, уже видели, что появилась новая…
  5. Sep 12, 2026Нелепости агентов Агентная разработка - веселая штука конечно. Вот планируешь и кодишь нес…
  6. Sep 11, 2026DS 4.1 Flash и галлюцинации Там новый дипсик впечатляющие результаты показывает на бенчах…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →