На официальном сайте Rails ведут открытый бенчмарк агентов. Первый этап — 21 маленькая задача на одно API фреймворка, и Claude Opus 5 на high проходит 92,1% прогонов. Второй — 20 тикетов для Fizzy, канбан-доски 37signals, написанных так, как их пишет продакт. Харнес тот же, модель та же:
25,0%.
Лучший результат на тикетах — 53,3% у GPT-6 Astra на максимальном усилии. Авторы прочитали прогоны и объясняют, откуда берутся нули. Дословно у них:
Тикет этого не говорит — значит, модель этого не делает.
Счастливый путь обычно на месте и работает. Падают граничные случаи, которые разработчик, уже делавший такую фичу, достроил бы без вопросов. Тикет «добавим японский, срочно» до конца довёл один прогон из всех: остальные перевели то, что видели, прогнали свои тесты, увидели зелёное и сдали.
Это сдвигает, где теперь работа. Раньше тикет читал коллега и додумывал за продакта. Теперь его читает исполнитель, который фреймворк знает, а ваших умолчаний — нет: пустой список, второй язык в письмах, старые записи без нового поля. Всё, что жило в голове и не попадало в текст, стало дырой в спецификации.
И дырой платной. Прогон Astra на максимуме стоит в среднем $6,63 — при таком проценте успеха это около $12,4 за закрытый тикет.
Слабые места у замера есть. В скрытые проверки авторы заложили случаи, которые проскочили бы и мимо человека, — они считают, что агент должен быть лучше. Этапы идут на разных приложениях, Writebook и Fizzy. А разницу в несколько пунктов между моделями они сами называют шумом.
https://rubyonrails.org/ai
Возьмите последний тикет, который агент сдал зелёным, а вы потом дописывали. Напишите, какого случая в тексте не было, — соберём список того, о чём тикеты обычно молчат.