TGViewer
VideoLab & Self-Motivated Learning VideoLab & Self-Motivated Learning @vgcourse · 1.28K subscribers
Post #370 1.25K
Господа!

Тут довольно любопытная статья выложена на архиве несколько дней назад "Measuring AI Ability to Complete Long Tasks".

Несложно заметить, что модели работают все лучше и лучше. А в каких попугаях измерять улучшение?

Их ключевая идея, это размечать задачи во времени, которое на них тратит средний человек. И дальше смотреть, как справляются модели с задачами в терминах времени.

Короче! На верхнем графике указано с каким количеством задач по сложности во времени модель справляется в 50% случаев.

По вертикали шкала логарифмическая и получилась сравнительно красивая почти линейная зависимость, из которой следует оценка экспоненциального роста: примерно каждые 7 месяцев модели справляются с вдвое более сложными по времени задачами. 🤔🙂

В подтверждение своего подхода они на подобную шкалу переложили данные любимого мной в этом сезоне SWE-bench (там тоже есть разметка во времени). И получили тоже очень близкую оценку даже для 80% success rate (нижний график).

Статья на 45 страниц и там есть на чем позалипать.

В качестве критики:

* 169 задач — выглядит маловато (с другой стороны они, похоже, взяли минимальное число, при котором доверительные интервалы на что-то разумное похожи), но в любом случае основной черрипик (если он есть ради красоты идеи) может быть именно в этом.

* Фундаментальная проблема подхода: Очевидно, с увеличением сложности задач разметка времени решения человеком будет становиться заметно дороже и сложнее, а в ближайшее время ровно такие задачи интересны. На задачах, которые требовали больше 4 часов, у них human success rate ниже 30%... 🤷‍♂️

* Взять за основу графика 50% или даже 80% success rate модели — это по сути оценивать "тех, кто допрыгнул". Не думаю, что сотрудник, который ошибается в 50% будет очень полезен. 😉 Очевидно, процентиль была взята для удобства прогноза на данный момент и судя по supplementary для 100% на данный момент график не такой красивый 😉

С другой стороны авторы явно понимают проблемы и спешат застолбить сам подход к предсказанию скорости прогресса, явно проговаривая, что еще нужно сделать, чтобы его улучшить. Там 25 авторов и работа выглядит очень неплохо проработанной.

В целом при текущем тренде условно к концу 2027 года модели будут с 50% success rate справляться с задачами, требующими 8 часов работы человека (возможно больше!), а к концу десятилетия — требующими недели работы человека (возможно раньше!). 100% success rate будет подтягиваться, видимо, медленнее, так что время у нас, дорогие кожаные, пока точно есть 😁 вопрос на что его потратить

Интересная работа. Надо будет найти ее на openreview через какое-то время и почитать, как ее покритиковали 😉

#speed_of_progress
  • ❤ 6
More from @vgcourse
  1. Sep 26, 2026Post #568
  2. Sep 12, 2026Post #567
  3. Sep 8, 2026Post #566
  4. Sep 8, 2026Всем привет! Уже завтра состоится вводная лекция спецкурса «Методы обработки и сжатия меди…
  5. Sep 2, 2026Post #564
  6. Aug 30, 2026Post #563
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →