📺 Fable 5 выполнил 16% реальных фриланс-проектов лучше профессионала. Год назад лучший результат был 4%
Это данные бенчмарка RLI от Center for AI Safety и Scale AI - агентам дают настоящие заказы (3D-модели, монтаж видео, архитектурные чертежи, анализ данных) и сравнивают результат с работой оплаченного специалиста. Оценивают работу живые эксперты в этой профессии.
RLI по сути прямой измеритель того, сколько реальной работы ИИ уже способен забрать себе.
А вот с оценкой результата у него (пока) не выходит. Разработчики бенчмарка попробовали доверить проверку другому ИИ - тот насчитал GPT-5.5 почти 18% успеха, хотя люди-эксперты нашли только 6%. Боты, проверяя друг друга, регулярно не видят проблем в работе.
Получается, что исполнителя ИИ заменяет уже сейчас, а критичным становится умение заказчика проверить, что реально получилось.
AI Practiq
Post #319
385

- 🏆 3
- ❤ 1