TGViewer
we all design 👑 we all design 👑 @wealldesigners · 1.06K subscribers
Post #1664 185
we all design 👑 Во вторник вышли claude opus 5.5 и openai sol 6. Изначально вообще не было от них каких-то ожиданий. Почему-то казалось, что это скорее модели про оптимизацию костов: выпустить модели подешевле для ежедневных задач. Но тут у меня закончились лимиты сначала…
В анонсе opus 5.5 был интересный график, как coding-модели ведут себя при разном effort.

И сначала довольно странно выглядит, что medium у некоторых моделей показывает результат лучше, чем high или xhigh. Ведь, по идее, чем дольше модель думает, тем лучше.

Услышала интересное объяснение: такие бенчмарки оценивают не просто качество результата, а насколько хорошо агент решил именно поставленную задачу.

Например, попросили исправить баг. На medium модель нашла баг, исправила и остановилась. На high может заодно заметить ещё несколько проблем, сделать рефакторинг, поменять abstraction, добавить тесты и что-то ещё улучшить.

В реальном проекте второй результат вполне может оказаться лучше. Но для этого бегчмарка часть этого уже может считаться выходом за scope.

Полезла смотреть, как вообще считается этот benchmark. Это FrontierCode от Cognition. Основной вопрос: принял бы maintainer такой PR? Смотрят correctness, тесты, regression safety, качество кода и отдельно scope, то есть не полезла ли модель менять больше, чем нужно для конкретной задачи.

И действительно, если модель заметит ещё несколько проблем рядом, сделает рефакторинг, решит поменять abstraction, добавить тесты и что-то ещё улучшить, для FrontierCode часть этого уже может считаться выходом за scope и снижается score.

Т.е. higher effort не обязательно делает модель хуже. Иногда она просто больше исследует, становится менее буквальной, но в какой-то момент может и уйти в overengineering.

@wealldesigners
  • ❤ 5
More from @wealldesigners
  1. Sep 24, 2026Во вторник вышли claude opus 5.5 и openai sol 6. Изначально вообще не было от них каких-то…
  2. Sep 22, 2026Какой-то невероятный эксперимент показали runway labs с responsive generative video interf…
  3. Sep 18, 2026Выделила время потестировать Jev от Typesafe. Взяла открытую базу рецептов TheMealDB, все…
  4. Sep 16, 2026Если используете llm внутри приложений и сервисов, которые собираете, для принятия решений…
  5. Sep 14, 2026На прошлой неделе у меня несколько раз спрашивали про классные визуальные референсы и где…
  6. Sep 11, 2026Кстати, попробовала закинуть в claude скриншоты и наработки и попросила собрать из них дин…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →