CAIS и Scale заявили, что Fable 5 теперь автоматизирует 16.1% реальных remote-work проектов. Это примерно в 2 раза выше результата Opus 4.8.
Речь про Remote Labor Index — бенчмарк, который проверяет, может ли AI выполнить оплачиваемую freelance-задачу на уровне, который примет заказчик.
Каждая задача включает бриф, файлы и профессиональный deliverable, с которым сравнивают результат человека.
В новых результатах лидирует Fable 5. Opus 4.8 набрал 8.3%, GPT-5.5 — 6.3%.
Да, 16.1% всё ещё означает провал на большинстве задач. Но динамика сильная: когда RLI только запускался, лучший результат был всего 2.5%.
Задачи там не игрушечные: CAD, архитектура, анимация, аудио, анализ данных, веб-приложения. То есть проверяется реальная работа в разных инструментах, а не ответы на текстовые вопросы.
Fable 5 особенно хорошо показал себя в задачах вроде моделирования кольца, анимации и дизайна ванной комнаты.
Есть важный нюанс: автоматический judge в целом неплохо ранжировал модели, но завышал качество GPT-5.5 примерно в 2.9 раза, а Opus 4.8 — примерно в 2.3 раза. Агенты быстро растут, но контроль качества остаётся жёстким ограничением.
Сама модель уже не весь продукт. Прирост идёт от более сильных agent setups: лучшее использование инструментов, полноценные desktop environments, профессиональный софт, длинные запуски и связки worker-critic, где один агент делает задачу, а второй проверяет её как придирчивый заказчик.
Post #1906
1.4K

- 👎 3