TGViewer
Channel Public Channel
Роман с данными

Роман с данными

@roma_data

Все о данных, ML, AI
Founder LLM Arena. Ex-Founder TrainingData.Pro
Окончил ВМК МГУ, 8 лет занимаюсь сбором и разметкой данных
Контакты: @roman_kucev
Subscribers
2.72K
Photos
98
Videos
23
Links
118

Showing posts older than #25 · Back to latest

Older Posts 20 shown
Post #24 1.55K
Всем привет!
Вдохновившись каналом CVML_team, я решил попробовать такой же формат подачи материала.
Итак, открываю рубрику “Кейсы, задачи, лучшие практики в Яндекс.Толоке”!)

В этом видео рассказываю как можно просто, быстро и качественно собрать датасет для задачи детекции лиц.

Интересно ли вам смотреть видео, или мне лучше продолжить писать текстики?

https://youtu.be/TF6Nyi2LAtE
  • 👍 1
Post #23 1.28K
Недавно общался с Андреем из OZON (правда он сейчас не в OZON, но это не важно). OZON использует труд толокеров, чтобы матчить товары и мониторить цены у конкурентов. И вы не представляете, сколько денег экономит им Толока, это колоссальные суммы! При этом интеграцией Толоки занимается команда состоящая менее, чем из 5 человек. Пять человек управляют десятками тысяч толокеров и закрывают одну из важнейших задач крупнейшего маркетплейса России!
Тут как раз проявляется закон Парето и эффект масштаба! Кстати, всем советую прочитать книгу Ричард Кох "Принцип 80/20”.

Думаю на этих строках текста я вам уже “продал” Толоку и обосновал всю ее мощь =) 
Но как “продать” ее большим компаниям?

Для этого нужны кейсы!
Как китайский IT директор не видит, что сегментацию можно использовать для эффекта боке, так и большие компании не видят, что Толоку можно использовать для множества задач.

И чтобы открыть глаза, показать всю выгоду, нужны примеры, кейсы и success story.
Почему я так считаю?

• Когда Дима Наумовец выпустил на VC статью "Как за 15 минут проанализировать десятки тысяч постов о своей компании и найти те, на которые необходимо ответить” ко мне пришло несколько клиентов с просьбой настроить то же самое.

• Через несколько месяцев после моей публикации на хабре "Создаем датасет для распознавания счетчиков на Яндекс.Толоке” с такой же задачей в Толоку пришел ЦФТ.  

• Тая Самарева своим докладом по SbS заинтересовала Avito и они тоже теперь используют SbS у себя.

• После моего вебинара по сбору данных на толоке появилось множество заданий по сбору различных видео, изображений и аудио.

• А после моего вебинара по сегментации кто-то начал тоже сегментировать ноги. С этого я максимально покекал 😅


Сейчас Толока начинает выходить на международный рынок. А значит мне нужно двигаться за ней. У меня есть несколько довольно крутых статей на хабре, но они на русском. Хочу перевести их и выложить на медиум. Кто может посоветовать хорошего переводчика?)
Post #22 848
Нам нужен эффект боке! Ваша сегментация человека нам не интересна! (с) один из b2b клиентов Prisma Inc.

Дело было в далеком 2017 году. Я только устроился в компанию Prisma и сразу попал на интересный проект: мы обучали нейронную сеть отделять на фотографии человека от заднего плана. На тот момент наша нейронка была на передовой технического прогресса, конкурентов еще не было, перед нами был голубой океан. Уже потом на рынок пришли конкуренты.

• Через пол года после нашего релиза Apple обучила свою нейронную сеть сегментировать человека и с помощью нее реализовала Portrait Mode на седьмых айфонах. 

• Через год пришел Remove.bg. Сразу получил титул 1 PRODUCT OF THE MONTH. Он имел превосходное качество работы, понятную и простую модель монетизации.

Пока конкурентов не было, мы всячески продвигали и пиарили наш продукт. Выпустили в Apple Store приложение Sticky AI, разместились на разных площадках.

В конце концов мы собрали демку с нашими основными технологиями и начали летать в США и Китай, показывать ее B2B клиентам. 

Больше всего мне запомнился один эпизод. 

У нас в SDK было множество продуктов. Среди них:

• Сегментация, где мы просто вырезали нейронкой человека и удаляли фон.

• Эффект боке. Тут мы тоже вырезали нейронкой человека. Но фон не удаляли, а размывали его.

Для нас, как разработчиков было очевидно, что эффект боке - это лишь пара строчек кода над “сегментацией”, которые вместо удаления фона, просто его блюрят. И мы были на все 100% уверены, что и всем остальным это очевидно. 

Но не тут то было! Итак, ситуация:

Шанхай, наш босс Артем Семьянов проводит презентацию нашего SDK перед одним из крупнейших мировых IT гигантов (вы точно знаете эту компанию, но назвать ее не могу, так как мой NDA действует еще 2 года). После безупречной презентации Артема (а Артем шикарно умеет это делать), директор китайского IT отдела заявляет:

“Нам очень понравилось, как работает ваш эффект боке, мы готовы рассмотреть покупку лицензии на SDK. Но хотим приобрести только эффект боке, сегментация нас не интересует”.

Вот такая вот забавная история.

Вы, наверное, спросите меня: зачем я написал столько текста? Какую мысль я хочу до вас донести? 

А мысль довольно проста:

У вас может быть офигенный продукт, офигенная технология, которая без проблем перевернет мир вокруг. Но если вы не сможете разжевать, на пальцах объяснить как эту технологию можно применить в бизнесе, как эта технология сможет сэкономить миллионы рублей, повысить продажи, уменьшить издержки, то НИКТО не будет использовать эту технологию. 

Вспомните сериал Silicon Valley: Ричард изобрел потрясающий алгоритм сжатия. Но сам по себе алгоритм никому не был нужен, и только интеграция алгоритма сжатия в стриминговый видеосервис принесла успех компании.

Сейчас в качестве “такого” продукта я вижу Яндекс.Толоку. 

С самого первого знакомства с Толокой я ощутил гибкость и мощь этого инструмента, меняющего полностью рынок труда в 21 веке. С помощью всего пары строчек кода я смог управлять десятками и сотнями тысяч “толокеров”. И те задачи, которые у меня в Prisma разметчики размечали месяцами, грозная армия толокеров размечала за считанные часы.

Но почему же Толока еще не захватила мир?

Мое мнение: рынок довольно консервативен и неэффективен. Изменения привычек и процессов происходит медленно. Компаниям тяжело поверить, что их центр из 200 профессиональных высококвалифицированных разметчиков высшей категории может заменить толпа анонимных людей без какой-либо квалификации. И при этом толпа:

• Будет выдавать более высокое качество

• Стоить в 2-3 раза ниже текущих профессионалов

• Будет легко масштабироваться под нужный объем задач и работать без передышки 24/7
Post #21 692
Сегодня посмотрел еще одно интересное видео от Мальцева Антона. Тема видео: "Как организовать разметку датасета? Самые простые способы”.

Забавно, но с Антоном я уже знаком. Их собранную базу автомобильных номеров мы использовали при создании домашнего задания для студентов ШАДа и ВШЭ.
 
Поэтому я выражаю огромную благодарность Антону за то, что разрешил использовать свою базку с номерами)

TL;DR
Существует несколько способов разметки данных:

• Краудсорсинг. Дешево, много исполнителей, но трудно получить высокое качество и нельзя размечать NDA данные. А 85% данных, с которыми работает Антон — это данные под NDA.

• Разметка на аутсорс. Плюсы: можно размечать NDA данные, быстро, высокое качество разметки, можно делать сложную разметку, фирма за вас решает все проблемы. Минусы: дорого, иногда не очень быстрое согласование и заключение договора.

• Найм частников для разметки. Плюсы: вы все контролируете. Минусы: много времени уходит на менеджмент. В 30% задач такой способ разметки заходит.

• Создание внутреннего отдела разметчиков. Используется, когда у вас есть постоянный набор данных для разметки, нужно высокое качество. Можно делать сложные инструменты для разметки. Минусы: довольно дорого и требует много внимания. Плюсы: иногда дешевле, чем найм фирм.

• Использование open source датасетов. Минусы: не все датасеты доступны для коммерческого использования,  open source может не полностью подходить под вашу задачу.

• Использования хитрого софта для самостоятельной быстрой разметки либо хитрой логики для создания датасета. Например автоматическая разметка от supervise.ly 

• Синтетика. Синтетика — очень тяжелый путь. Это не всегда оптимальный подход. Но иногда синтетика -— единственный выход.
Post #20 595
Сегодня посмотрел интервью Ильи Красинского про принципы мышления и стратегии жизни. Про краудсорсинг он не рассказывал, да и вряд ли он знает что это такое.

Тогда почему я решил поделиться этим интервью в своем канале?

Мне понравилась одна мысль, которая заставила меня сильно задуматься.
1:44:10 “До этапа проектирования мы вводим обязательный момент: сначала все сделать руками. Шаблонизация процессов — один из главных грехов менеджера. При шаблонизации хаоса и бардака ты получишь шаблонизированный хаос и бардак”

И как мне кажется, эта мысль отлично ложится на краудсорсинг. Ко мне очень часто приходят различные заказчики. И я их довольно просто разделяю на два типа:

Тип №1.
Эти заказчики знают свои данные и понимают что хотят получить на выходе. Обычно они уже либо размечали данные сами, либо отдавали на разметку своим людям. А в Толоку решили прийти, чтобы оптимизировать и масштабировать разметку. Обычно у таких заказчиков:

• Есть сформированное четкое ТЗ

• Уже есть выстроенный пайплайн по разметке без использования крауда

• Есть примеры входных и выходных данных

• Собраны все различные редкие кейсы, которые встречаются в данных.

Работать с такими заказчиками — одно удовольствие. Работа идет слаженно, в срок и без проблем.

Тип №2.
Противоположность типу №1. Они еще не размечали данные. Да и скорее всего их даже не видели. Плохо представляют что хотят получить на выходе. Только погружаются в разметку данных, но решили сразу использовать краудсорсинг, так как это модно и хайпово. Обычно:

• ТЗ максимально размыто и абстрактно. Меняется каждые два дня

• О сложных и непонятных случаях в данных ничего неизвестно

• Хотят получить 100% качество

• Часто просят переразметить данные, так как “получили не то, что ожидали"


Настройка крауда — это долгий и довольно сложный процесс. Выстроить, а потом менять процесс разметки inhouse асессоров в десятки раз проще и быстрее, чем менять процесс разметки в крауде.

Поэтому, если я вижу, что заказчик еще “зеленый” и неопытный, то я его настоятельно прошу попробовать поразмечать данные сначала самому, набить все шишки, задетектить все подводные камни и уже прийти ко мне с более глубоким пониманием задачи. 
Иначе, выстроив масштабированный сбор данных в котором хаос и бардак, мы на выходе получим масштабируемый хаос и бардак.

Спасибо Илье Красинскому за прекрасное интервью!
YouTube #9: Илья Красинский про принципы мышления и стратегии жизни Илья Красинский—CEO & Co-Founder Rick.ai, проводит тренинг Product Heroes, мастер спорта по юнит-экономике, один из крутейших продактов России. Расшифровка и список книг тут: https://zamesin.me/ru-podcast-krasinsky/ Я покупал курс Ильи и получил очень много…
Post #19 608
“Если хочешь в чем-то досконально разобраться, попробуй объяснить это другим людям”(с) Рома

Моя осень выдалась очень насыщенной на образовательные программы.

Вместе с моим коллегой Лешей Космачевым мы делаем курс "Машинное обучение на больших данных” на Coursera для ВШЭ. В нем я рассказываю все о разметке данных и подготовке данных к обучению ML моделей. Курс планируем завершить до нового года. Я обещаю, что расскажу о нем побольше, как только он выйдет) 

Но только этим курсом мои образовательный программы не заканчиваются. Даша Байдакова из Яндекс.Толоки предложила мне провести лекцию и семинар для студентов ШАДа и ВШЭ в рамках курса "Сбор и обработка данных с помощью краудсорсинга”. И я, конечно, согласился)

Делюсь с вами видео семинара: youtu.be/mUI-I74_ydU
В нем рассказываю о трендах и методах оптимизации качества, скорости и стоимости разметки. 
Как мне кажется, главный тренд, который я уже наблюдаю — всевозможная интеграция ML в процесс разметки. 
Поэтому студентам рассказал:

• 2:00 Сколько данных нужно, чтобы обучить ML модель

• 15:17 Что такое Active Learning

• 20:55 Какие особенности возникают при работе с синтетическими данными

• 25:15 Почему заходит Pseudo Labeling

• 27:13 Как с помощью предразметки увеличить скорость разметки до 10 раз

• 31:10 Как концепция Human in the Loop позволяет достигать 100% точности

• 1:06:47 Как я реализовал сервис на основе краудсорсинга “Впечатлятор” и заработал 40 000 руб


А также выдал довольно интересную домашку по реализации концепций Human in the Loop и Pre-labelling с помощью Яндекс.Толоки! 
github.com/Kucev/human_in_the_loop_task

Друзья, а какие вы видите тренды в разметке данных?
YouTube Сбор и обработка данных с помощью краудсорсинга — семинар 2 ноября 2020 Методы оптимизации разметки для computer vision задач. Преподаватель – Роман Куцев Курс "Сбор и обработка данных с помощью краудсорсинга", ПМИ ФКН ВШЭ
Post #18 550
Наконец наступили выходные и я добрался до просмотра семинара “Crowdsourcing с механической поддержкой”.
https://youtu.be/xulVH9rG-70
Докладчик: Игорь Кураленок (руководитель Yandex.Cloud ML) рассказал очень много интересных идей, так что всем, кто интересуется краудсорсингом, рекомендую этот семинар к просмотру.

TL;DR

• 10:45 Яндекс хитро разделяет набор данных на train и test. Он использует два контура: контур для обучения и контур для оценки моделей. Каждый контур обладает своими свойствами и способами работы в нем.

• 29:29 Чем объемнее и сложнее инструкция, тем более калиброванные оценки мы получаем, но при этом в таких оценках уменьшается экспертное мнение.

• 38:55 Обратная связь крайне важна для асессора.

• 41:16 Если дать возможность асессорам общаться, то ВОЗМОЖНО они будут выдавать более точные ответы.

• 1:23:00 В агрегацию ответов асессоров можно подмешивать ответы ML модели.

• 1:29:22 В некоторых проектах Яндекс использует ML модель для проверки ответов Толокеров.

• 1:42:08 Пайплайн по аннотации аудиозаписей. Круто что Яндекс делится такой интересной инфой со всеми.
YouTube Crowdsourcing с механической поддержкой Тема семинара: Crowdsourcing с механической поддержкой Докладчик: Игорь Кураленок (руководитель Yandex.Cloud ML) Ссылка на презентацию: https://speakerdeck.com/mlseminar/crowdsourcing-s-miekhanichieskoi-poddierzhkoi Дата: 15.10.2020
Post #17 554
  • ❤ 1
Post #16 590
И снова у нас интересный проект!

Выделение ключевых точек на лице человека.
Когда работал в Prisma, у нас постоянно были такие задачи. В те времена мы размечали лендмарки с помощью VGG Image Annotator своим штатом разметчиков. 

Сейчас мы в TrainingData.ru стараемся полностью отказаться от своих разметчиков и все задачи пытаемся реализовывать с помощью краудсорсинга.

Конечно, еще далеко до идеала, и штат разметчиков продолжает существовать) Но все чаще вместо самой разметки, он валидирует ответы толокеров, присланные на задания с постприемкой. Так что движемся к нужной цели!)

Поэтому и в этот раз мы решили попробовать выделять точки через Яндекс.Толоку.
Какие основные сложности у нас возникли в этом проекте?

Возникло всего две сложности:

1.  Автоматические методы проверки правильности выставленных точек потерпели фиаско в этой задаче.

2. На лице нужно поставить 68 точек! И это реально много, в среднем на одно изображение уходит по 10 минут. А если толокер ошибается даже в одной точке, то весь его труд идет коту под хвост.


Но сложности для того и существуют, чтобы их преодолевать. А справились мы с ними довольно очевидными методами:

1. Проверку осуществили с помощью постприемки своими “бывшими” разметчиками. Да, ручной труд у  нашей команды остается, но проверять разметку в десятки раз быстрее, чем размечать изображения самим с нуля.  

2. Мы воспользовались главным принципом краудсорсинга: “Если получается  — декомпозируй”. Разбили все точки на подгруппы: щеки, рот, глаза, нос, брови. В каждой подгруппе получилось 10-17 точек. Затем разметку каждой подгруппы точек мы разместили в отдельном задании. Таким образом выполнять и проверять задания стало на много проще.
  • ❤ 1
Post #13 764
А вас раздражает маленькое окошко для редактирования кода интерфейса задания?
Меня да, и очень сильно!

Для удобства я реализовал скрипт, который делает окно шире. 
Делюсь им с вами, вдруг тоже пригодится?
Post #12 567
В этом году у нашей компании появились заказчики не только из России.
Первый мой иностранный заказчик: японский стартап Laboro.
Для них мы делали довольно сложную сегментацию помидоров.

Недавно они выложили собранный датасет в открытый доступ.
Поэтому я не могу не похвастаться своим творением!)
https://laboro.ai/column/laboro-tomato/
https://github.com/laboroai/LaboroTomato
Приятно осознавать, что данный датасет теперь будут использовать не только в коммерческих целях, но и в научных)

Датасет размечал с помощью Яндекс.Толоки отобранными лучшими толокерами)
  • ❤ 1
Post #11 515
Мои выводы: даже такой странный проект можно реализовать через Толоку.  Да, многие толокеры будут присылать мусор, но с помощью постпроверки без проблем получится отсеять и получить только качественные аудиозаписи.
Older posts →
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →