TGViewer
Закиев Василь. (AI)ron manager Закиев Василь. (AI)ron manager @zvasilchannel · 6.17K subscribers
Post #2818 735
Что на самом деле измеряет бенчмарк METR: 17,4 часа — это часы человека, а не модели

Почти во всех статьях этот бенчмарк подают как «сколько часов модель может работать самостоятельно». METR в своём FAQ отвечает на этот вопрос прямо: нет. Горизонт — это мера сложности задачи, а не время, которое тратит модель. На задачах, которые агенты доводят до конца, они обычно в несколько раз быстрее человека.

Меряют так: берут задачу, на которую у эксперта-человека уходит N часов, и смотрят, доводит ли её модель до конца хотя бы в половине попыток. Это и есть N-часовой горизонт модели.

Рекорд сейчас у довольно старой закрытой модели Anthropic Claude Mythos Preview: 17,4 часа, задача на два рабочих дня специалиста. Более свежие модели ещё не тестировали. Сколько времени на неё потратила сама модель, METR не публикует: это зависит от провайдера инференса и обвязки.

В рейтинг METR модель добавили в мае. METR сами предупреждают: выше 16 часов их результаты ненадёжны, длинных задач с реальным человеческим замером в наборе мало. Рекорд уже чуть выше этой границы, а горизонт растёт быстрее: раньше удвоение занимало семь месяцев, теперь три-четыре.

Поэтому в текущем виде бенчмарк сейчас не актуален.

metr.org/time-horizons

#ИИ #агенты
  • 👍 2
More from @zvasilchannel
  1. Oct 10, 2026#мемы про ИИ
  2. Oct 9, 2026Grok Bot Маска теперь думает на Claude Opus 5.5, хотя у него есть Grok 4.7 7 октября Илон…
  3. Oct 8, 2026Мой опыт, мои цитаты: «Спасибо за поготовку презентации для клиента. Я даже не буде правит…
  4. Oct 7, 2026Скоро у нас в Искре «живые презентации». Это демка: https://cloud.iskrabot.ru/boards/737b8…
  5. Oct 7, 2026Агентам нужен запасной режим для работы без лимитов Говорят, что всем сервисам с оплатой п…
  6. Oct 6, 2026NerfBench: бенчмарк, который проверяет, не «понерфили» ли модель Стал ли Opus 5.5 тупее по…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →