Всем привет!
При работе с Толокой мы в TrainingData.Solutions практически всегда используем следующую схему:
• Толокеры собирают/размечают данные
• Постприемку заданий осуществляют внутренние асессоры, либо кураторы проекта
В идеальной картине мира и по канонам краудсорсинга нужно делать по-другому: задача должна быть разбита на пул разметки и пул проверки и решаться полностью через крауд.
Но у нас такая схема не заходит по следующим причинам:
• Именно от валидаторов зависит качество разметки. Валидатор должен быть вовлеченным в процесс, на 100% понимать какой финальный результат нужно получить, уточнять все вопросы у ML команды. Этого можно добиться только при очень скрупулезной настройке проекта валидации.
• Хорошо настроить процесс валидации занимает в 3-4 раза больше времени, чем настройка проекта разметки с постприемкой. Необходимо настроить ханипоты, обучение, экзамен, грамотно написать инструкцию с примерами, покрывающими все кейсы, предусмотреть все возможные варианты обмана со стороны Толокеров. На это расходуется огромное кол-во времени.
• Трудно связать проект разметки и валидации. Для этого нужно быть гуру в Toloka-Kit, чтобы с помощью API выстроить пайплайн переливания данных из одного проекта в другой.
По итогу нам дешевле, быстрее, и проще посадить внутренних асессоров на проверку 🙁
И вот я задаюсь вопросом: это только у нас так, или вы тоже сталкиваетесь с похожей проблемой?
Как вы выстраиваете процесс валидации заданий? Поделитесь опытом)
Какие варианты нашел я:
• С помощью jupyter notebook писать виджет по проверке заданий. Видео. Код.
• Выдавать инхаус валидаторам доступ к Толоке и делать отдельно интерфейс для постприемки. Но проблема возникает, когда валидаторов становится много, мы сделали специальное расширение, чтобы контролировать процесс.
• Использовать нейронки для автоматической проверки
• Объединять проекты с помощью Pachyderm и организовывать валидацию через private crowd
Post #70
1.85K
- 👍 11
- 🔥 1
- 🌭 1