TGViewer
Жить и управлять | Александр Стома Жить и управлять | Александр Стома @mgmt_decoded · 191 subscribers
Post #415 69
Center for AI Safety (CAIS) и Scale Labs обновили результаты Remote Labor Index (RLI) — бенчмарка, который проверяет ИИ-агентов на настоящих фриланс-заказах: 3D и CAD, архитектура, дизайн, видео и анимация, аудио, аналитика данных, веб-приложения. Живой эксперт сравнивает работу агента с эталонной работой оплаченного профессионала, и решает, справился ли ИИ. Новая модель Claude Fable 5 показала лучший результат за всю историю теста по ключевой метрике automation rate (доля проектов, принятых как минимум наравне с человеческой работой) — 16,1%. Это почти вдвое больше, чем у Opus 4.8 (8,3%), и еще больше, чем у GPT-5.5 (6,3%).

Когда RLI только запустили в конце октября 2025 года, лучший агент автоматизировал лишь 2,5% проектов. Планка росла постепенно: предыдущим лидером был Opus 4.6 со связкой Claude Cowork — 4,17%. А за неполные восемь месяцев показатель вырос примерно в шесть раз, и авторы теста называют это конкретным сигналом того, насколько быстро ИИ-агенты приближаются к реальной экономической пользе, а не просто к более высоким баллам в лабораторных бенчмарках.

В общем, постепенно мир идёт в том, что на определённых задачах ИИ будет точно сильнее, быстрее и дешевле делать задачи.

#ai
  • 👍 2
More from @mgmt_decoded
  1. Sep 26, 2026Если вы любите фантастику, и найдёте в своём календаре 3 часа – посмотрите Интерстеллар, р…
  2. Sep 24, 2026Post #520
  3. Sep 23, 2026Поскольку мы проводим много времени на работе, то часто рабочие роли замывают личные, семе…
  4. Sep 21, 2026Как AI-агент может изменить рабочие процессы, и сколько экономит. На картинке предваритель…
  5. Sep 21, 2026Вчера услышал у Саймона Синека идею Джеймса Карса о конечных и бесконечных играх. Второй д…
  6. Sep 20, 2026Вчера утром я еще не знал, что сегодня вечером буду в Беларуси (Саша, 100% не знал). Событ…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →