TGViewer
Channel Public Channel
Роман с данными

Роман с данными

@roma_data

Все о данных, ML, AI
Founder LLM Arena. Ex-Founder TrainingData.Pro
Окончил ВМК МГУ, 8 лет занимаюсь сбором и разметкой данных
Контакты: @roman_kucev
Subscribers
2.72K
Photos
98
Videos
23
Links
118

Showing posts older than #71 · Back to latest

Older Posts 20 shown
Post #70 1.85K
Всем привет!
При работе с Толокой мы в TrainingData.Solutions практически всегда используем следующую схему:
• Толокеры собирают/размечают данные
• Постприемку заданий осуществляют внутренние асессоры, либо кураторы проекта

В идеальной картине мира и по канонам краудсорсинга нужно делать по-другому: задача должна быть разбита на пул разметки и пул проверки и решаться полностью через крауд.

Но у нас такая схема не заходит по следующим причинам:
• Именно от валидаторов зависит качество разметки. Валидатор должен быть вовлеченным в процесс, на 100% понимать какой финальный результат нужно получить, уточнять все вопросы у ML команды. Этого можно добиться только при очень скрупулезной настройке проекта валидации.
• Хорошо настроить процесс валидации занимает в 3-4 раза больше времени, чем настройка проекта разметки с постприемкой. Необходимо настроить ханипоты, обучение, экзамен, грамотно написать инструкцию с примерами, покрывающими все кейсы, предусмотреть все возможные варианты обмана со стороны Толокеров. На это расходуется огромное кол-во времени.
• Трудно связать проект разметки и валидации. Для этого нужно быть гуру в Toloka-Kit, чтобы с помощью API выстроить пайплайн переливания данных из одного проекта в другой.

По итогу нам дешевле, быстрее, и проще посадить внутренних асессоров на проверку 🙁

И вот я задаюсь вопросом: это только у нас так, или вы тоже сталкиваетесь с похожей проблемой?
Как вы выстраиваете процесс валидации заданий? Поделитесь опытом)

Какие варианты нашел я:
• С помощью jupyter notebook писать виджет по проверке заданий. Видео. Код.
• Выдавать инхаус валидаторам доступ к Толоке и делать отдельно интерфейс для постприемки. Но проблема возникает, когда валидаторов становится много, мы сделали специальное расширение, чтобы контролировать процесс.
• Использовать нейронки для автоматической проверки
• Объединять проекты с помощью Pachyderm и организовывать валидацию через private crowd
  • 👍 11
  • 🔥 1
  • 🌭 1
Post #69 1.7K

Forwarded from DataStart | 3 июля | конференция Data Science

Роман Куцев. Преподаватель краудсорсинга в ШАДе, ВШЭ, МФТИ. CTO TrainingData.Solutions.

Доклад “Как получать высокое качество размечаемых данных”

"В рамках доклада расскажем, чем отличается хороший датасет от плохого, какие необходимые свойства должен иметь хороший датасет и как их достичь. Поговорим о способах контроля качества и о том как выстроить пайплайн разметки внутри компании. Рассмотрим основные ошибки при организации процесса разметки и как их можно избежать."

• Отличия между Data-Centric и Model-Centric подходами
• Итеративный подход к разметке: плюсы и минусы
• Построение эффективного процесса обучения разметчиков
• Методы контроля качества
• Основные ошибки в менеджменте разметчиков

🔥 Регистрация - https://clck.ru/pkj2i
  • 🔥 10
Post #68 1.44K
14 июня выступаю на онлайн конференции DataStart, расскажу “Как получать высокое качество размечаемых данных” . Конференция бесплатная, регистрируйтесь😉
Post #67 1.77K
Всем привет!
Я решил воспользоваться своим положением админа канала и запостить интересную вакансию к себе в команду😀

Ищу backend разработчика к нам в TrainingData.Solutions.

Наша команда собирает и размечает данные на заказ для обучения нейронных сетей.
Мы уже больше 4 лет на рынке, в нашем штате 450 разметчиков и 20 кураторов, каждый год растем в несколько раз и сейчас расширяем IT команду. В связи с этим открылась новая позиция.

Наши разметчики работают через CVAT и Label Studio, это open source инструменты для разметки данных.
Требуется поддержка этих инструментов, а именно:
• Контроль и разворачивание инфраструктуры в Yandex Cloud
• Поддержка работоспособности CVAT и Label Studio на наших серверах
• Написание скриптов по переносу данных и конвертации разметки в разные форматы
• Написание микросервисов по автоматизации рутинных процессов
• Техническая поддержка кураторов проектов

Какие навыки требуются:
• уверенные знания docker для разворачивания инструментов
• python для написания скриптов и микросервисов
• git, s3, bash, FastAPI

Условия:
• гибкий график, главное чтобы задачи делались к дедлайну и CVAT не падал
• удаленная работа, хоть на Бали, хоть в Воронеже
• если вы в РФ, то оформляем как самозанятого, а если нет, то платим с нашего юр лица в ОАЭ
• 20 часов в неделю - идеально, если вы студент или имеете основную работу

За успешную рекомендацию дарим AirPods Pro

По всем вопросам смело пишите в ЛС😉
  • 🔥 6
  • 👍 1
Post #66 1.33K
Все же люблю Теслу за их data-driven подход и то, как они эффективно используют свои данные. 

Выше видосик, в котором они рассказывают о том как собирают у пользователей данные для улучшения моделей.
  • 👍 7
Post #65 1.4K
Всем привет! 

В эту пятницу буду выступать на конференции mergeconf с докладом "Краудсорсинг - новый подход к организации работы в 21 веке”, на нем расскажу:
• О концепции краудсорсинга
• Какие задачи можно решить с помощью крауда
• Бесконечное масштабирование: главные плюсы и минусы краудсорсинга
• Почему это тренд 21 века?

Если вы тоже будете на этой конференции, пишите, с радостью встречусь и пообщаюсь с вами вживую😉
  • 👍 6
  • 🔥 6
  • ❤ 1
Post #64 1.96K
В последнее время замечаю, как ML отделы различных компаний переходят от Model-Centric подхода к Data-Centric. Считаю это правильным трендом, который позволит делать ML продукты еще лучше. 

Для нас в TrainingData.Solutions от этого конечно хлопот добавляется: все чаще размечаем данные небольшими итерациями, в несколько этапов обсуждаем и дорабатываем инструкцию по разметке, версионируем данные и внедряем новые фишки по контролю качества. Но хороший результат этого стоит)

Специально чтобы осветить новый тренд, на хабре выложил перевод статьи, в которой рассказывается отличие датацентрического подхода от моделецентрического.
https://habr.com/ru/post/661457/
Хабр Датацентрический и моделецентрический подходы в машинном обучении Код и данные — фундамент ИИ-системы. Оба эти компонента играют важную роль в разработке надёжной модели, но на каком из них следует сосредоточиться больше? В этой статье мы сравним методики, ставящие...
  • 🔥 15
Post #63 1.94K
На прошлой неделе поучаствовал в подкасте Антона Мальцева, автора ТГ канала "Заметки Computer Vision инженера”.

Обсудили с Антоном тренды в разметке, inhouse разметку, краудсорсинг, предразметку и многое другое.
На записи звук у меня получился немного 💩 . Прошу понять и простить.

Прикладываю ссылку на подкаст: https://youtu.be/FH6nwtFR9nU

И таймлайн, чтобы проще найти нужный материал:
0:58 - Роман Куцев, о себе
1:30 - in-house или краудсорсинг 
2:21 - Критерий перехода от in-house на краудсорсинг
3:25 - Подходы для разметки данных на примере
3:40 - Подход с in-house отделом
4:20 - Подход с краудсорсингом
5:39 - Краудсорсинг или in-house?
8:40 - Обзор краудсорсинговых платформ
13:10 - Инструменты для in-house разметки
18:35 - Когда стоит использовать предразметку
21:58 - О защите данных заказчика
24:00 - Часто ли попадаются повторяемые задачи
26:14 -  Какие по размеру фирмы чаще заказывают разметку
29:15 - Много ли встречается сложных/хитрых задач
32:14 - О работе с зарубежными заказчиками
35:24 - Продажа готовых датасетов
39:08 - О найме людей для разметки
41:53 - Как происходит работа над проектом
YouTube Как делать разметку в 2022 - разбираем с профессионалом 0:00 - Начало 0:58 - Роман Куцев, о себе 1:30 - in-house или краудсорсинг 2:21 - Критерий перехода от in-house на краудсорсинг 3:25 - Подходы для разметки данных на примере 3:40 - Подход с in-house отделом 4:20 - Подход с краудсорсингом 5:39 - Краудсорсинг…
  • 👍 8
Post #61 1.57K

Forwarded from ml.log | AI, ML & MLOps (Alexander C)

🚀 @SBERLOGA online seminar on machine learning:
👨‍🔬 Роман Куцев (TrainingData.Solutions) «Методы оптимизации процесса разметки для обучения нейронных сетей.»
⌚️ Четверг 13 января, 18.00 по Москве

Описание:
• Сколько данных нужно для обучения нейронной сети
• Что выгоднее: улучшать архитектуру нейронной сети или увеличивать датасет
• Зачем использовать Active Learning
• Как предразметка позволяет удешевить создание датасета
• В чем главный плюс концепции Human in the Loop
• Тренды в разметке данных

Ссылка на зум будет доступна в чатах: https://t.me/sberlogadataclub ближе к началу доклада.
  • 👍 11
Post #60 1.41K
Всем привет! Сегодня в 18:00 буду рассказывать как ускорять и улучшать качество разметки. Кому интересно присоединяйтесь)
  • 🔥 1
Post #59 2.84K
Итак, наш 2021 год подходит к концу. Количество подписчиков за год выросло в 7 раз. Мне очень приятно, что вы подписываетесь, комментируете и обсуждаете мои посты. Это значит, что я рассказываю о чем-то интересном и полезном для вас. 
Обещаю и в 2022 радовать вас интересным контентом!

И в предверии нового 2022 года я хочу вам рассказать об одной привычке, которую я внедрил в этом году.
У меня есть две интересные особенности:

•Я крайне любознательный и очень люблю изучать все новое

•Мне интересна разметка данных, и можно сказать, что я живу этим


Поэтому я очень много читаю про эту область. Раньше я просто читал, что-то выписывал, брал к себе на заметку.
Но потом подумал, а почему об этом должен знать только я? И решил все статьи, которые я прочитал и они мне понравились, переводить и выкладывать на хабр. Таким образом за год я перевел 23 интересных статьи. Сейчас решил собрать все ссылки на них в одном месте.
Так что вот мой подарок для вас в виде интересного контента:

· 5 трендов в аннотировании данных в 2021 году
· Как организовать разметку данных для машинного обучения: методики и инструменты
· 6 правил по обеспечению качества данных для машинного обучения
· 5 этапов, гарантирующих успешную разметку данных
· Методика машинного обучения Human-in-the-Loop
· Как создать эффективный план разметки данных?
· Семантическая сегментация 4D сцен с лидаров и прогресс в разработке беспилотных автомобилей
· Зачем вам нужно использовать активное обучение при обучении нейронных сетей
· Как избавиться от проблем при разметке данных для обучения ML моделей?
· Оптимизация разметки данных с помощью активного обучения
· Способы обеспечения качества данных для машинного обучения
· Почему 87% проектов data science не добираются до продакшена?
· Пять альтернатив Scale AI
· Почему за автоматической разметкой данных будущее?
· Как Hasty использует автоматизацию и быструю обратную связь для обучения моделей ИИ
· Как размечать данные для машинного обучения
· Руководство по типам аннотирования изображений
· Аннотирование текста для машинного обучения
· Лучшие платформы аннотирования изображений для компьютерного зрения на 2019 год
· Лучшие инструменты разметки изображений для компьютерного зрения 2020 года
· Лучшие инструменты аннотирования для компьютерного зрения в 2021 году
· 7 способов получить качественные размеченные данные для машинного обучения
· Топ-5 инструментов для разметки данных в 2021 году
И мой авторский контент:
· Создаем датасет для распознавания счетчиков на Яндекс.Толоке
· Создаем свой датасет с пришельцами
· Как создать свой датасет с Киркоровым и Фейсом на Яндекс.Толоке
· Обзор инструментов для разметки в CV
· Кейс: как с помощью чат-бота создать датасет из более 10 тысяч изображений за пять недель
· Как стать сертифицированным партнёром Толоки
· Собираем датасет для системы антиспуфинга
· Примеры использования краудсорсинга в бизнесе
· Разметка лиц с помощью краудсорсинга
· Методы оптимизации процесса разметки для обучения нейронных сетей
· Как мы выиграли первый в России хакатон по краудсорсингу
· Как собрать данные с помощью Толоки
· Вебинар по сегментации изображений в Толоке
  • 👍 2
Post #58 1.31K
Выложил перевод статьи про концепцию Human-in-the-Loop. На мой взгляд статья довольно толковая, на пальцах объясняет плюсы данного подхода и отличия от модели Waterfall.

https://habr.com/ru/post/596353/

А вы используете Human-in-the-Loop для своих задач? Как организуете процесс?

В рамках курса "Сбор и обработка данных с помощью краудсорсинга" мы рассказали студентам ВШЭ и ШАДа, как внедрять HITL, а также сделали интересную домашку. Если вам тоже интересно ознакомиться, вот ссылка: github.com/Kucev/human_in_the_loop_task
Хабр Методика машинного обучения Human-in-the-Loop Human-in-the-loop AI — это технология автоматизации, устраняющая многие проблемы разработки и внедрения машинного обучения. Большинство проектов создания ИИ завершается провалом. 80% никогда не...
Post #57 1.32K
Всем привет! Ровно через час буду выступать на онлайн конференции DataStart c докладом
"Методы оптимизации процесса разметки для обучения нейронных сетей”

Расскажу:
• Сколько данных нужно для обучения нейронной сети
• Что выгоднее: улучшать архитектуру нейронной сети или увеличивать датасет
• Зачем использовать Active Learning
• Как предразметка позволяет удешевить создание датасета
• В чем главный плюс концепции Human in the Loop
• Тренды в разметке данных

Регистрация на конференцию бесплатная. Кому интересно присоединяйтесь 😉

P.S Записи не будет, но материал моего доклада на 80% пересекается с материалом, который я читаю в ШАДе и ВШЭ, вот ссылка на него: https://youtu.be/mUI-I74_ydU
  • 👍 1
Post #56 1.63K
Посмотрел сегодня Tesla AI Day.
https://youtu.be/j0z4FweCy4M

Больше всего впечатлил блок про
1:24:35 - Manual Labeling 
1:28:11 - Auto Labeling

Интересные факты:
• Тесла имеет внутренний штат разметчиков из 1000+ человек и собственную инфраструктуру для разметки данных
• Тесла перешла от 2D разметки к 4D, что позволило ускорить разметку в 100 раз
• Тесла использует синтетические данные для обучения своих моделей 
• По реальным данным Тесла научилась генерировать виртуальный мир

Как мне кажется, Тесла сейчас на передовой IT индустрии, и мне было интересно узнать какие фишки и идеи они внедряют)
YouTube Tesla AI Day 2021 Join us to build the future of AI → https://www.tesla.com/ai 0:00 - Pre-event 46:54 - AI Day Begins 48:44 - Tesla Vision 1:13:12 - Planning and Control 1:24:35 - Manual Labeling 1:28:11 - Auto Labeling 1:35:15 - Simulation 1:42:10 - Hardware Integration …
  • 👍 1
Post #55 1.36K
Небольшой камень в сторону Толоки.
Я являюсь сооснователем компании TrainingData.Solutions
Мы занимаемся сбором и разметкой данных для обучения ML.

Обычно мы размечаем данные двумя способами:
1. Внутренним штатом исполнителей
2. Через краудсорсинг, а именно через Толоку

Перед каждым проектом мы выбираем, каким способом его оптимально решить: inhouse или через краудсорсинг.

Inhouse команда в основном используется, когда нужно работать с NDA данными, либо когда для разметки требуются узкоспециализированные специалисты, например, врачи онкологи.

Краудсорсинг отлично заходит, когда необходимо что-то сделать очень быстро, или массово. Через Толоку мы проводим UX исследования, оценку качества поиска, антиспуфинг атаки, простую детекцию, сегментацию, транскрибацию, сбор данных.

Мы работаем официально, у нас в РФ зарегистрирована ООО на УСН, внутренние разметчики устроены по договору как самозанятые. В Толоке мы зарегистрированы как юр лицо из РФ. 
И тут возникает довольно остро вопрос налогообложения. 

Предположим у нас есть Вася, который работает у нас как самозанятый и толокер Петя. И каждому мы хотим выплатить на руки 100 руб. 

Чтобы заплатить Васе 100 руб, нам нужно 106.38 руб (100 Васе и 6% налог на самозанятого).

С Петей все интереснее. Чтобы Петя получил 100 руб, мы должны заплатить 130 руб Яндексу (комиссия 30%). Но это не финальные траты. Так как договор у нас с российским Яндексом, то по закону мы сверх всей суммы должны платить НДС 20%. Таким образом, чтобы заплатить Пете 100 руб, мы должны потратить 152 руб. При этом Толока сама пытается перевести всех исполнителей из РФ на самозанятость и Петя получит 94 руб. 

В таком случае Вася получит 94% от суммы, которую мы потратили, а Петя 61%. 
Если, вдруг, Яндекс сделает комиссию 50%, то Петя уже получит 52%

Мои подписчики, у меня к вам вопрос: какие есть лазейки с этим НДС? Может ли РФ компания заключиться на прямую с иностранным Яндексом? Есть ли фирмы посредники из-за границы?

Сейчас из-за этого НДС появляется дискриминация заказчиков из РФ (физлиц и юр лиц на УСН), для них услуги выходят на 20% дороже, чем для иностранных заказчиков.
Post #54 1.35K
Недавно общался со своим другом Ринатом, который работает в Boston Consulting. Разговор зашел о трендах в разметке и куда движется отрасль. Вместе пришли к выводу, что индустрия разметки данных в 2021 очень похожа на индустрию колл-центров в 2000-х годах.

А что же было с колл-центрами 20 лет назад?
Бизнес только зарождался, процессы были не оптимальны, автоматизации практически не было. Но был дикий спрос на эти услуги! Каждая фирма, каждый магазин, банк имел свой внутренний колл-центр, в котором сотни людей 24/7 отвечали на входящие звонки.

Что же происходит с колл-центрами сейчас?
Забавно, но пару лет назад я работал в Тинькофф и занимался задачами по оптимизации процессов в колл-центре. И что я могу точно сказать: колл-центры медленно умирают. 
И главная причина этому: автоматизация. Людей просто заменили. Заменили на машин. Машинам не нужно платить зарплату, машины не берут больничный, отпуск, они работают 24 на 7. В отличии от людей.

Голосовые помощники, роботы, чат-боты стали обыденностью. Они уже без проблем решают простые вопросы (которых процентов 80), а на оставшиеся 20% сложнейших робот переводит на оператора.

Таким образом, бизнесу удается уменьшить штат операторов в несколько раз. И если раньше компаниям нужно было 20-30 операторов колл-центов, то сейчас достаточно 3-4 человек и подписки на NLab или Twin.

То же самое ждет и разметку данных. 
Благодаря автоматизации получится повысить производительность разметчиков в десятки раз. Всю простую разметку будет делать машина, а задача человека - проверять за машиной и размечать сложные кейсы.

И самое интересно, что эра автоматизации уже наступила.
На этих выходных я обнаружил офигенный стартап Hasty.ai. 
Идея стартапа максимально проста - упростить и ускорить разметку.

Фича, которая мне больше всего понравилась: после разметки 30 картинок, на них моментально обучается нейронка и все следующие картинки размечает уже она, а ты просто сидишь и проверяешь за ней.

Я попробовал уже разметить пару своих проектов и технология на них себя просто офигенно показала.
У Hasty.ai есть два наглядных демо. Если вы хотите увидеть как будет происходить разметка 90% данных через пару лет, рекомендую зарегистрироваться в Hasty.ai и с ними ознакомиться.

А как вы думаете, что ждет область разметки данных через пару лет?
  • 👍 2
Post #53 1.31K
Всем привет!
Давно не писал в ТГ канале. Причина проста: работы очень много и не доходят руки рассказать вам о чем-то интересном. А за последние 2 месяца много чего произошло, уж поверьте) 

А раз работы много, то мы расширяем команду TrainingData.ru!
Итак, ищу человека, который будет моей правой рукой и будет помогать настраивать, мониторить и оптимизировать проекты в Толоке. 

Если вы хотите стать крутым Crowd Solutions Architect, то это отличная возможность прокачать свои навыки. Каждый месяц мы запускаем десятки новых проектов на тысячи долларов в Толоке и создаем нетривиальные пайплайны по разметке данных. 

Условия: 20 часов в неделю, гибкий график, удаленная работа. Можно без проблем совмещать с учебой/основной работой. 
Зарплата: от 40к руб в месяц за part-time. 

Заинтересовались? Пишите в ЛС @roman_kucev
P.S. Репост приветствуется
Post #51 1.33K
Post #50 1.27K
Перевел статью "How to Organize Data Labeling for Machine Learning: Approaches and Tools” и выложил на хабр. Статья состоит из двух частей: “Методологии разметки" и “Инструменты для разметки”. Эту статью я прочитал еще в 2018 году, и именно она меня вдохновила перейти из ML в разметку.

К сожалению, за 3 года большинство описанных в статье инструментов устарели. При этом методологии разметки на мой взгляд до сих пор не утратили актуальность. Так что всем интересующимся рекомендую к прочтению) 

Ссылка на перевод: https://habr.com/ru/post/572508/
Post #49 1.22K
Уже больше года я общаюсь с людьми из Random Coffee. Узнаю у них что-то новое, рассказываю про себя.
И довольно часто от них слышу один и тот же вопрос:
Вот вы размечаете данные, чтобы обучать нейронные сети. А что вы будете делать, когда все нейронные сети будут обучены? 

Большинство людей уверены, что скоро человечество создаст нейронные сети под любые задачи и разметчики больше будут не нужны. 

Отчасти они правы. Я уже четвертый год занимаюсь разметкой данных и вижу как меняется рынок. 
Да, нейронные сети с каждым годом решают все больше задач. И если несколько лет назад у нас заказывали простую разметку для задач Face Detection, License Plate Recognition, то сейчас разметку для таких задач практически не заказывают, так как уже есть множество хорошо работающих решений. Зачем самому обучать нейронную сеть находить лица людей, если можно купить LUNA SDK?

При этом область AI активно развивается. Но чем же ученые занимаются сейчас?

Ученые перешли на более сложные задачи, которые раньше не могли решить.

Как вы можете узнать из рассказа Ольги Мегорской, AI сейчас держится на трех китах:
1. Алгоритмы
2. Вычислительные мощности
3. Данные

За последние несколько лет алгоритмы продвинулись далеко вперед, появились BERTы, трансформеры, дипфейки. Развитие вычислительных мощностей тоже не стояло на месте. Если раньше для обучения ResNet требовалось более 1000 видеокарт и несколько месяцев, то теперь любой может обучить ResNet за 40$ и 18 минут.

А что же с данным? Тренды интересные)

Для обучения более сложных алгоритмов теперь нужно еще больше данных. 
Например, BERT обучали на корпусе, состоящим из более 3х миллиардов слов. А для обучения ASR наша команда транскрибировала более 30 000 часов аудио, потратив на это более 120 000 человеко-часов.

При этом и сама разметка стала еще сложнее.
Все чаще приходится размечать данные высококвалифицированными специалистами. У нас в штате уже более 20 врачей размечают опухоли головного мозга на МРТ, детектируют пораженные участки легких на КТ, классифицируют больные зубы на рентгеновских снимках.
А недавно мы начали размечать данные с лидаров (лидары - это такие приборы, похожие на локаторы, благодаря которым беспилотные автомобили могут видеть объекты вокруг себя).

Так что разметчики еще не скоро останутся без работы.
Older posts →
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →