Как понять, что клон действительно повторяет действия реального человека?
Продолжаем предыдущую тему про скиллы, которые копируют работу конкретного сотрудника. Брендан Фуди, гендиректор ИИ-стартапа Mercor, говорит, что компании тратят «до 100 миллионов долларов в год на прогон моделей», не имея офлайн-оценки, т.е. набора реальных рабочих задач, на которых можно сравнить модели до внедрения.
KateBench — скилл, повторяющий поведение реального главреда, — тут же стал наглядным примером. Редакторы принимали 85–90% его правок — такая цифра на любой презентации выглядела бы впечатляюще. Однако инженер проекта Янник Юнг объяснил, почему верить ей нельзя. Выяснилось, что:
1. На длинных текстах инструмент останавливался после 40 предложенных правок.
2. На одном и том же куске текста система каждый раз выдавала разные варианты.
3. Высокий процент принятых правок маскировал реальный объём работы, которую человеку всё равно приходилось доделывать руками.
Вывод команды: нужно выбрать одну повторяющуюся рабочую задачу, задокументировать пять типичных провалов на реальных примерах и проверять модели именно на них.
Получается, клонировать суждение человека в скилл — только половина задачи. Вторая половина — постоянно перепроверять, что клон действительно «думает как человек», а не просто проделывает какую-то работу, которая со стороны кажется очень убедительной.
Post #49
166