TGViewer
VideoLab & Self-Motivated Learning VideoLab & Self-Motivated Learning @vgcourse · 1.28K subscribers
Post #471 1.02K
Господа!

Одна из наиболее интересных бенчмарков последнего времени, это METR Time Horizon (про который я писал тык, тык), неделю назад без особой помпы обновился до версии 1.1.

Этот бенчмарк интересен тем, что построен на закрытом датасете (сегодня такие бенчмарки хотя бы относительно что-то показывают), т.е. в первой версии 64 задачи (из 189) было открыто и 125 закрыто. Суммарно на его разметку было потрачено 1500 часов работы людей и он неплохо показывает скорость усложнения задач, с которыми справляются модели.

В Time Horizon 1.1 они:
* на 34% увеличили число задач (до 228)
* удалили 15 задач (посчитанных неудачными)
* обновили 53 задачи (описание, либо уточнена оценка по времени).
* на графике выше видно, что существенно выросло число длинных задач, с одной стороны наиболее дорогих в разметке, с другой — наиболее интересных с текущей скоростью развития агентов.

Увы статьи еще нет, только пост, поэтому неизвестно, сколько новых задач будет раскрыто (есть ссылка на гитхаб, но я его не парсил).

Также много мелких (но важных для точности и удобства оценки) изменений в методике, типа того, что они сменили фреймворк оценки с самописного на получивший популярность. Это явно удешевит развитие.

У меня впечатление, что они прямо старались остаться в рамках старых доверительных интервалов, но в любом случае:

* Общий тренд с 2019 года: время удвоения горизонта ~196 дней (≈7 месяцев), что соответствует предыдущим оценкам

* С 2023 года: время удвоения сократилось со 165 дней (TH1) до 131 дня (TH1.1) — прогресс на 20% быстрее

* С 2024 года: время удвоения составляет всего 89 дней (TH1.1) против 109 дней (TH1)

Это означает, что они констатируют УВЕЛИЧЕНИЕ ВРЕМЕНИ УСПЕШНО РЕШАЕМЫХ ЗАДАЧ БОЛЬШЕ, ЧЕМ В 16 РАЗ ЗА ГОД последние два года! 😲

Важная оговорка — они рассматривают 50% и 80% success rate, что в большинстве задач заметно ниже типичных требований работодателя. Но 80% растет примерно с той же скоростью!

В этой новостью хорошо рифмуется вчерашняя новость, как команда агентов на Opus 4.6 Антропиков за неделю написала полноценный С-компилятор на Rust под платформы x86, ARM и RISC-V (собирать под несколько платформ это очень круто, кто понимает). Агенты потратили 20000$ через API, написали 100000 строк кода компилятора, который может собрать ядро Linux 6.9! Я когда-то пересобирал ручками ядро Linux под не самое стандартное железо, тогда даже на gcc это было эпопеей. Заняло неделю... Кроме этого у них собрались SQLite и Doom (код которых не самый тривиальный из-за оптимизаций).

Здесь впечатляет именно быстрый рост сложности задачи. Если бы в начале 2023 после выхода GPT сказали, что через 3 года агенты будут писать компилятор ядра Линукса за неделю, то крутили бы пальцем у виска примерно все, кто хоть сколько-нибудь понимает в теме. А создатели моделей достигли этого и продолжают увеличивать сложность задач.

Что у них будет следующей планкой по уровню? 🤔

Смотрю на ситуацию в легком обалдении! Пока скорость наступления будущего растет.

Больше материалов на тему:
#speed_of_progress@vgcourse

@vgcourse
  • ❤ 3
More from @vgcourse
  1. Sep 26, 2026Post #568
  2. Sep 12, 2026Post #567
  3. Sep 8, 2026Post #566
  4. Sep 8, 2026Всем привет! Уже завтра состоится вводная лекция спецкурса «Методы обработки и сжатия меди…
  5. Sep 2, 2026Post #564
  6. Aug 30, 2026Post #563
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →