“Если хочешь в чем-то досконально разобраться, попробуй объяснить это другим людям”(с) Рома
Моя осень выдалась очень насыщенной на образовательные программы.
Вместе с моим коллегой Лешей Космачевым мы делаем курс "Машинное обучение на больших данных” на Coursera для ВШЭ. В нем я рассказываю все о разметке данных и подготовке данных к обучению ML моделей. Курс планируем завершить до нового года. Я обещаю, что расскажу о нем побольше, как только он выйдет)
Но только этим курсом мои образовательный программы не заканчиваются. Даша Байдакова из Яндекс.Толоки предложила мне провести лекцию и семинар для студентов ШАДа и ВШЭ в рамках курса "Сбор и обработка данных с помощью краудсорсинга”. И я, конечно, согласился)
Делюсь с вами видео семинара: youtu.be/mUI-I74_ydU
В нем рассказываю о трендах и методах оптимизации качества, скорости и стоимости разметки.
Как мне кажется, главный тренд, который я уже наблюдаю — всевозможная интеграция ML в процесс разметки.
Поэтому студентам рассказал:
• 2:00 Сколько данных нужно, чтобы обучить ML модель
• 15:17 Что такое Active Learning
• 20:55 Какие особенности возникают при работе с синтетическими данными
• 25:15 Почему заходит Pseudo Labeling
• 27:13 Как с помощью предразметки увеличить скорость разметки до 10 раз
• 31:10 Как концепция Human in the Loop позволяет достигать 100% точности
• 1:06:47 Как я реализовал сервис на основе краудсорсинга “Впечатлятор” и заработал 40 000 руб
А также выдал довольно интересную домашку по реализации концепций Human in the Loop и Pre-labelling с помощью Яндекс.Толоки!
github.com/Kucev/human_in_the_loop_task
Друзья, а какие вы видите тренды в разметке данных?
Post #19
608