TGViewer
Женя, расскажи про AI Женя, расскажи про AI @that_ai_guy · 374 subscribers
Post #101 592
Кринж-METR 1/2

Есть такая организация, и вы сто процентов о ней слышали, если последний год не были в изоляции от AI-новостей, — METR.

Чуваки проводят различные исследования в области искусственного интеллекта. Самые популярные из которых — про замедление разработчиков, которые пишут код, используя LLM, и про то, насколько долго модели могут работать автономно.

Так вот, оба этих исследования — дикий булшит. AI-лабы особенно любят исследование про автономную работу LLM, так как оно даёт пользователям очень наглядную метрику того, насколько модель крутая (спойлер — не даёт).

Но давайте обо всём по порядку.

18 марта 2025 года METR выпускает своё первое хайпанувшее исследование «Measuring AI Ability to Complete Long Tasks», которое они продолжают обновлять по сей день.

В исследовании чуваки создали metrику того, какие задачи модель способна выполнить автономно. Но вместо того, чтобы дать модели сложную задачу, которую она будет выполнять на протяжении какого-то количества часов, а затем замерить справилась, ли она с ней, они взяли за основу то, сколько потребуется человеку, чтобы выполнить поставленную задачу.

Вы уже прочувствовали всю гениальность этого исследования? По сути, METR по каким-то своим metrикам решили, что найти факт в интернете занимает 7 минут, натренировать классификатор — около 1 часа, а разработать сложный протокол на основе нескольких RFC — где-то 10 часов.

Другими словами, если модель решит задачу, которую METR оценили как 10-часовую, за 5 минут, то она улетит в самый верх графика автономности, хотя модель проработала всего пару минут.

При этом я не видел ни одного чисто новостного источника, который подсвечивал бы эту разницу, а она критически важна и переворачивает смысл исследования с ног на голову.

Ну, окей, это исследование, хоть и сильно вводит в заблуждение, но под определённым углом рассмотрения и градусом читающего его с натяжкой, но можно воспринять как что-то более-менее адекватное. К счастью, у METR есть ещё одно хайпанувшее исследование, но уже напрочь оторванное от реальности!
  • 👍 6
  • 🥴 3
  • 🤨 2
  • 😱 1
More from @that_ai_guy
  1. Mar 13, 2026AlphaEvolve от Google DeepMind открыла новые нижние оценки для чисел Рамсея, улучшив резул…
  2. Mar 12, 2026В продолжение постов об исследованиях от METR На скриншоте — количество задач, которые мы…
  3. Mar 9, 2026Мы получили Cyberpunk 2077 в реальной жизни до выхода GTA 6 Помните бреиндансы из Cyberpun…
  4. Mar 7, 2026Кринж-METR 2/2 10 июля 2025 года METR выпускает новое исследование «Measuring the Impact o…
  5. Mar 6, 2026Про качество кода от моделей Сегодня на созвоне вскользь поднимали тему качества кода от м…
  6. Mar 5, 2026Ваш воркфлоу (скорее всего) переусложнён В то время как все улучшают свои workflow: докиды…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →