🤔💡Как Spotify создал платформу для масштабных аннотаций: опыт и результаты
Spotify в своей статье How We Generated Millions of Content Annotations поделился кейсом, как удалось масштабировать процесс аннотаций для разработки ML и GenAI моделей. Эти улучшения обеспечили обработку миллионов треков и подкастов, ускорив создание и обновление моделей.
Основные шаги:
1️⃣ Масштабирование человеческой экспертизы:
✅Основные команды: аннотаторы (первичный обзор), аналитики качества (решение сложных случаев), менеджеры проектов (обучение команд и связь с инженерами).
✅Автоматизация: внедрили систему на базе больших языковых моделей (LLM) для поддержки аннотаторов, что позволило значительно сократить затраты и усилия.
2️⃣ Новые инструменты для аннотаций:
✅Разработаны интерфейсы для сложных задач (например, аннотация аудио/видео сегментов или текстов).
✅Созданы метрики для мониторинга: количество выполненных задач, объем данных, продуктивность аннотаторов.
✅Введен показатель «согласованность» аннотаций, чтобы автоматически отправлять спорные случаи экспертам.
3️⃣ Интеграция с ML-инфраструктурой:
✅Построили гибкую архитектуру с возможностью использовать разные инструменты.
✅Добавили CLI и UI для быстрого запуска проектов.
✅Интегрировали аннотации в производственные ML-пайплайны.
😎Результаты:
✅Объем аннотаций увеличился в 10 раз.
✅Производительность аннотаторов выросла в 3 раза.
✅Снизилось время запуска новых моделей.
Post #673
626