Как сократить разметку в 2-3 раза: эксперимент Embedika с активным обучением
Разметка данных для обучения ИИ — дорогой и трудозатратный процесс. Особенно в сложных доменах, вроде юридических текстов, где нужна экспертиза. Часто оказывается, что значительная часть размеченных данных не даёт существенного прироста качества модели.
Руководитель ИИ-разработки Embedika Валерия Басова поделилась в TProger опытом: как активное обучение позволяет сократить объем разметки без потери качества, и подтвердила это результатами эксперимента.
В материале разобрали на практике:
▫️ Как устроен цикл активного обучения и чем он отличается от ручной разметки;
▫️ Три ключевые стратегии отбора данных (Uncertainty Sampling, Diversity Sampling и Query by Committee) и как они работают;
▫️ Насколько активное обучение сокращает объем разметки: стратегия Entropy потребовала в 2-3 раза меньше размеченных примеров, чтобы выйти на тот же уровень качества, что и случайный отбор;
▫️ Почему универсальной стратегии не существует, и выбор всегда требует проверки под конкретную задачу и данные.
🔗 Полная версия статьи доступна на сайте TProger
#сми_о_нас
Post #1150
149

- 🔥 7
- ❤ 3
- 👍 2
- 💯 1