Один пилот, два отчёта: город насчитал 48 замечаний, поставщик - 83. Часть 1
Скоро процент найденных замечаний начнут называть и нам. Москва говорит о «точности на 80 процентов», Главгосэкспертиза с 1 октября тестирует ИИ-ассистента, в презентациях поставщиков стоит «90 с лишним». Чтобы понимать, что за цифрой, разберём единственный документ, где видно, от чего её считали.
О чём речь. Город Сиэтл обкатывал сервис проверки заявок на строительство и выложил отчёт целиком. Поставщик сервиса описал тот же пилот у себя на сайте. Два отчёта, один пилот, разные числа.
Как устроена машина. Она проверяет по списку требований, который в неё заранее загрузили. Чего в списке нет, она не смотрит. И в отчёте по таким требованиям пусто: ни замечания, ни пометки «не проверялось».
Что получилось в Сиэтле.
- Живые проверяющие нашли 90 замечаний.
- 35 из них касались требований, которых в список не вносили.
- Ещё 7 были в списке, но машина их пропустила.
- Нашла она 48.
Поставщик пишет: найдено 83 из 90, пропущено 7. Разница между 48 и 83 - ровно те 35 требований. У города они вынесены отдельной строкой, а в счёте поставщика оказались среди «найденных».
Формально он не соврал: ошибок по этим требованиям действительно не было. Но не было потому, что машина туда не смотрела.
Что с доверием к российским цифрам. Я нашёл один российский тест, где названы и числа, и методика: комплект на 40 страниц, 14 проблем, найдено 13. Но он вендорский, на своём продукте, один комплект, и авторы сами пишут, что это не исследование. У Москвы «80 процентов» без базы сравнения. У Главгосэкспертизы чисел пока нет. Независимой проверки чужих сервисов я не нашёл ни у кого.
Часть 2 - про то, зачем при этом нужна экспертиза и какие два вопроса снимают расхождение 👇
#практика #экспертиза #ИИ_для_инженера #AIпесочница
AI песочница инженера в Дзене 📱|в МАХ 📲|в VK 📱|в VC|
Post #415
691
- ❤ 2
- 👍 1
- 👌 1