TGViewer
Refat Talks: Tech & AI Refat Talks: Tech & AI @nobilix · 11.7K subscribers
Post #176 6.15K
RLI - довольно уникальный в своем роде серьезный бенчмарк, который меряет не абстрактные навыки, а способность AI делать настоящую оплачиваемую работу, сравнивая лоб в лоб с фрилансерами на Upwork. И он показал что AI-агенты проваливают 97.5% реальных задач проектов. Довольно интересно, хотя не все так просто - давайте разбираться.

Итак буквально на днях исследователи из Scale выпустили Remote Labor Index (RLI) - взяли реальные фриланс-проекты, которые люди делали за деньги. От 3D-анимации до архитектурных планов, от создания игр до научных документов. Общая стоимость работ - $144K. Средний проект занимал у человека 29 часов и стоил $633. Сравнивали GPT-5, Claude Sonnet 4.5, Gemini 2.5 Pro, Manus.

Лучший агент (Manus) выполнил 2.5% проектов. Manus заработал $1720 из возможных $144K.

Важный нюанс: RLI тестирует не производственные операции типа "суммаризируй документ" или "напиши функцию", а проекты - законченную работу, которые фрилансеры выполняли за деньги. Методология: наняли 358 верифицированных фрилансеров с Upwork, собрали 550 проектов, отфильтровали до 240 качественных. Каждый проект - это brief + input files + human deliverable, который реальный клиент принял и оплатил. Оценку делали вручную обученные эксперты (94.4% agreement между оценщиками) по принципу "принял бы reasonable client эту работу или нет".

Внимательный читатель заметит: где software development? Ведь именно там агенты показывают лучшие результаты - SWE-Bench и прочие coding benchmarks. Код в RLI есть (веб-разработка, игры), но его намеренно меньше - реальный рынок гораздо разнообразнее.

Методологические вопросы

Странная история с выбором моделей: сравнивают специализированную агентную систему Manus с продуктами широкого назначения типа Claude и GPT. Было бы логичнее включить Claude Code и обвесить его тулами, например.

Второй момент - воспроизводимость. Такой замороченный бенчмарк с ручной оценкой дорого поддерживать. Да и открыли только 10 из 240 проектов (чтобы избежать contamination), manual evaluation занимает в среднем 11-17 минут на проект. Масштабировать это сложно, надеюсь не забросят.

Где побеждает и где проваливается

AI хорошо справился с узким набором задач:
- Аудио: звуковые эффекты, разделение вокала от инструментов
- Генерация картинок: логотипы, ads
- Написание отчетов
- Data visualization и веб-скрейпинг
То есть там, где либо чистая генерация контента, либо простой код.

Провалы кластеризуются так:
- 45.6% - низкое качество работы (буквально "child-like drawings", любительский уровень)
- 35.7% - неполные deliverables (видео на 8 секунд вместо 8 минут, missing files)
- 17.6% - технические проблемы (битые файлы, неправильные форматы)
- 14.8% - неконсистентность (дизайн дома меняется между разными 3D-видами)

Кстати, забавная деталь: GPT-5 лучше работал через CLI (1.7% automation), чем через computer-use интерфейс (0.8%).

Практические выводы

Для разработчиков AI-продуктов:
- Не обещайте клиентам полную автоматизацию сложных процессов. Даже близко не готовы.
- Human-in-the-loop очень важен.
- Узкие задачи работают и чем дальше тем лучше.

Для всех:
- Ваша работа в безопасности (пока)
- Но Elo scores растут с каждой новой моделью - траектория идет вверх.
- Бенчмарк показывает: между "AI производит что-то похожее на правду" и "AI делает работу профессионального уровня" - огромная пропасть.
- 2.5% success rate одновременно и отрезвляет, и показывает прогресс: ну типа представьте, машине дали коммерческий проект на вход как человеку, не подготавливая как-то специально и не поправляя по ходу выполнения, и она на полном автомате хоть в каком-то проценте случаев поняла и выдала результат, который условно приняли и оплатили.

Исследование детальное, стоит полистать: https://arxiv.org/abs/2510.26787

У них есть интерактивный сайт, где можно сравнить работы людей и моделей - реально интересно посмотреть на конкретные примеры провалов и успехов.

🔥 ➕ 🔁
  • 🔥 41
  • ❤ 12
  • 👍 10
  • ❤‍🔥 3
More from @nobilix
  1. Sep 24, 2026bb plugin atlas - чтобы плагины для bb писать не вслепую Это продолжение поста про bb и ст…
  2. Sep 21, 2026Стрим про getbb.app! Мы уже в эфире. Подключайтесь по ссылке: https://youtube.com/live/rQW…
  3. Sep 19, 2026#ReDigest Продолжаем субботнюю рубрику, тут я кратко рассказываю про новости из мира техно…
  4. Sep 18, 2026Jev - это сенсор, а не собеседник Вы уже могли слышать про TypeSafe AI (основатель - соавт…
  5. Sep 15, 2026Что вы знаете про bb? Они называют себя "AI IDE that builds itself". Достаточно молодой пр…
  6. Sep 12, 2026#ReDigest Продолжаем субботнюю рубрику, тут я кратко рассказываю про новости из мира техно…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →