Center for AI Safety (CAIS) и Scale Labs обновили результаты Remote Labor Index (RLI) — бенчмарка, который проверяет ИИ-агентов на настоящих фриланс-заказах: 3D и CAD, архитектура, дизайн, видео и анимация, аудио, аналитика данных, веб-приложения. Живой эксперт сравнивает работу агента с эталонной работой оплаченного профессионала, и решает, справился ли ИИ. Новая модель Claude Fable 5 показала лучший результат за всю историю теста по ключевой метрике automation rate (доля проектов, принятых как минимум наравне с человеческой работой) — 16,1%. Это почти вдвое больше, чем у Opus 4.8 (8,3%), и еще больше, чем у GPT-5.5 (6,3%).
Когда RLI только запустили в конце октября 2025 года, лучший агент автоматизировал лишь 2,5% проектов. Планка росла постепенно: предыдущим лидером был Opus 4.6 со связкой Claude Cowork — 4,17%. А за неполные восемь месяцев показатель вырос примерно в шесть раз, и авторы теста называют это конкретным сигналом того, насколько быстро ИИ-агенты приближаются к реальной экономической пользе, а не просто к более высоким баллам в лабораторных бенчмарках.
В общем, постепенно мир идёт в том, что на определённых задачах ИИ будет точно сильнее, быстрее и дешевле делать задачи.
#ai
Post #415
69

- 👍 2