TGViewer
Этихлид Этихлид @etechlead · 6.99K subscribers
Post #309 3.13K
С бенчмарками для кодинговых агентов сейчас стало довольно неопределённо.

Мне думается, что мы уже живём в какой-то пост-бенчмарк эпохе, когда всё сложнее и сложнее становится объективно оценивать модели.

Тут, с одной стороны - сатурация бенчей, с другой - их контаминация и прочие проблемы с недоверием и методологиями, а с третьей ещё и то, что разницу на повседневных задачах между современными моделями и агентами стало непросто измерить.

Тем не менее, новые бенчи появляются, и их авторы стараются учесть проблемы прошлых поколений, сделать более честные проверки и поднять планку сложности в тестах для агентов.

Так что завтра поговорим обо всём вокруг кодинговых бенчмарков на стриме ⬇️

#announcement #stream #benchmarks
  • 🔥 11
  • 👍 7
  • ❤ 3
  • 👏 2
  • 🎉 2
More from @etechlead
  1. Sep 22, 2026Конвертируем Enterprise-проект в Dark Factory Dark Factory - цех без света, потому что люд…
  2. Aug 26, 2026MAS vs SAS: код писать научились, работать вместе - пока нет (2.2/4) Начало ⬆️ 🔴 Доверие…
  3. Aug 26, 2026MAS vs SAS: код писать научились, работать вместе - пока нет (2.1/4) В первой части были о…
  4. Aug 25, 2026MAS vs SAS: границы применимости (1/4) Мультиагентные системы в целом и для разработки в ч…
  5. Aug 20, 2026Мы начинаем наш стрим "Как писать код с AI-агентами?" Подключайтесь по ссылке: https://you…
  6. Aug 16, 2026Как писать код с AI-агентами? А если командой? Что нужно учесть, чтобы этот код не положил…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →