В анонсе opus 5.5 был интересный график, как coding-модели ведут себя при разном effort.
И сначала довольно странно выглядит, что medium у некоторых моделей показывает результат лучше, чем high или xhigh. Ведь, по идее, чем дольше модель думает, тем лучше.
Услышала интересное объяснение: такие бенчмарки оценивают не просто качество результата, а насколько хорошо агент решил именно поставленную задачу.
Например, попросили исправить баг. На medium модель нашла баг, исправила и остановилась. На high может заодно заметить ещё несколько проблем, сделать рефакторинг, поменять abstraction, добавить тесты и что-то ещё улучшить.
В реальном проекте второй результат вполне может оказаться лучше. Но для этого бегчмарка часть этого уже может считаться выходом за scope.
Полезла смотреть, как вообще считается этот benchmark. Это FrontierCode от Cognition. Основной вопрос: принял бы maintainer такой PR? Смотрят correctness, тесты, regression safety, качество кода и отдельно scope, то есть не полезла ли модель менять больше, чем нужно для конкретной задачи.
И действительно, если модель заметит ещё несколько проблем рядом, сделает рефакторинг, решит поменять abstraction, добавить тесты и что-то ещё улучшить, для FrontierCode часть этого уже может считаться выходом за scope и снижается score.
Т.е. higher effort не обязательно делает модель хуже. Иногда она просто больше исследует, становится менее буквальной, но в какой-то момент может и уйти в overengineering.
@wealldesigners
Post #1664
185
we all design 👑 Во вторник вышли claude opus 5.5 и openai sol 6. Изначально вообще не было от них каких-то ожиданий. Почему-то казалось, что это скорее модели про оптимизацию костов: выпустить модели подешевле для ежедневных задач. Но тут у меня закончились лимиты сначала…

- ❤ 5