Кринж-METR 1/2
Есть такая организация, и вы сто процентов о ней слышали, если последний год не были в изоляции от AI-новостей, — METR.
Чуваки проводят различные исследования в области искусственного интеллекта. Самые популярные из которых — про замедление разработчиков, которые пишут код, используя LLM, и про то, насколько долго модели могут работать автономно.
Так вот, оба этих исследования — дикий булшит. AI-лабы особенно любят исследование про автономную работу LLM, так как оно даёт пользователям очень наглядную метрику того, насколько модель крутая (спойлер — не даёт).
Но давайте обо всём по порядку.
18 марта 2025 года METR выпускает своё первое хайпанувшее исследование «Measuring AI Ability to Complete Long Tasks», которое они продолжают обновлять по сей день.
В исследовании чуваки создали metrику того, какие задачи модель способна выполнить автономно. Но вместо того, чтобы дать модели сложную задачу, которую она будет выполнять на протяжении какого-то количества часов, а затем замерить справилась, ли она с ней, они взяли за основу то, сколько потребуется человеку, чтобы выполнить поставленную задачу.
Вы уже прочувствовали всю гениальность этого исследования? По сути, METR по каким-то своим metrикам решили, что найти факт в интернете занимает 7 минут, натренировать классификатор — около 1 часа, а разработать сложный протокол на основе нескольких RFC — где-то 10 часов.
Другими словами, если модель решит задачу, которую METR оценили как 10-часовую, за 5 минут, то она улетит в самый верх графика автономности, хотя модель проработала всего пару минут.
При этом я не видел ни одного чисто новостного источника, который подсвечивал бы эту разницу, а она критически важна и переворачивает смысл исследования с ног на голову.
Ну, окей, это исследование, хоть и сильно вводит в заблуждение, но под определённым углом рассмотрения и градусом читающего его с натяжкой, но можно воспринять как что-то более-менее адекватное. К счастью, у METR есть ещё одно хайпанувшее исследование, но уже напрочь оторванное от реальности!
Post #101
592
- 👍 6
- 🥴 3
- 🤨 2
- 😱 1