TGViewer
КайфКодинг КайфКодинг @vibecodingartem · 1.01K subscribers
Post #1019 105
Агент валит продуктовый тикет не на коде. Он валит его на том, чего в тикете не написано.

На официальном сайте Rails ведут открытый бенчмарк агентов. Первый этап — 21 маленькая задача на одно API фреймворка, и Claude Opus 5 на high проходит 92,1% прогонов. Второй — 20 тикетов для Fizzy, канбан-доски 37signals, написанных так, как их пишет продакт. Харнес тот же, модель та же:

25,0%.

Лучший результат на тикетах — 53,3% у GPT-6 Astra на максимальном усилии. Авторы прочитали прогоны и объясняют, откуда берутся нули. Дословно у них:


Тикет этого не говорит — значит, модель этого не делает.

Счастливый путь обычно на месте и работает. Падают граничные случаи, которые разработчик, уже делавший такую фичу, достроил бы без вопросов. Тикет «добавим японский, срочно» до конца довёл один прогон из всех: остальные перевели то, что видели, прогнали свои тесты, увидели зелёное и сдали.

Это сдвигает, где теперь работа. Раньше тикет читал коллега и додумывал за продакта. Теперь его читает исполнитель, который фреймворк знает, а ваших умолчаний — нет: пустой список, второй язык в письмах, старые записи без нового поля. Всё, что жило в голове и не попадало в текст, стало дырой в спецификации.

И дырой платной. Прогон Astra на максимуме стоит в среднем $6,63 — при таком проценте успеха это около $12,4 за закрытый тикет.

Слабые места у замера есть. В скрытые проверки авторы заложили случаи, которые проскочили бы и мимо человека, — они считают, что агент должен быть лучше. Этапы идут на разных приложениях, Writebook и Fizzy. А разницу в несколько пунктов между моделями они сами называют шумом.

https://rubyonrails.org/ai

Возьмите последний тикет, который агент сдал зелёным, а вы потом дописывали. Напишите, какого случая в тексте не было, — соберём список того, о чём тикеты обычно молчат.
Ruby on Rails: Compress the complexity of modern web apps Rails and AI — Ruby on Rails Rails gives AI coding agents a convention-driven, expressive framework for building production-quality software quickly.
More from @vibecodingartem
  1. Sep 27, 2026121 млн новых репозиториев на GitHub за 2025 год. Звучит как 121 млн новых продуктов — но…
  2. Sep 26, 2026photo post
  3. Sep 26, 2026Полка: сделали с агентом — покажите другим Агенты делают хорошие отчёты, страницы и протот…
  4. Sep 26, 2026Агент OpenAI вышел в интернет через DNS, чтобы спросить чужой чатбот OpenAI выложил отчёт…
  5. Sep 26, 2026Дизайн не отстал от инженерии. Он единственный не ускорился — и поэтому теперь выглядит то…
  6. Sep 25, 2026Число, которое Jev выдаёт за калиброванную вероятность, меряет не шанс попасть. Оно меряет…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →