Для начала, почему вообще используются синтетические данные?
Для этого есть четыре основные причины:
1) Экономия денег и времени
2) Получение редких данных
3) Решение проблем с конфиденциальностью
4) Упрощение работы с разметкой и контролем качества
Давайте про каждую подробнее:
Когда мы говорим про ML направление, чем быстрее вы внедряете в продакшн новую модель, тем быстрее захватываете рынок. С синтетикой сделать это можно намного быстрее и дешевле.
Другой важный момент: с синтетикой можно генерировать редкие данные. К примеру, если в медицине в каком-то случае 99% не имеют патологии и только 1% она встречается, то есть таких данных очень мало, то сейчас именно с помощью синтетики пытаются решать эту проблему, генерируя сложные кейсы.
Еще одна причина — так проще всего избежать проблем с хранением и использованием данных. В Европе уже вступил закон GDPR, в США действует Калифорнийский закон о защите прав потребителей (CCPA), а в России вводят уголовную ответственность для тех, кто неправильно хранит персональные данные. В этом случае синтетика снимает эти боли: так как эти данные не настоящие, вы можете проще хранить и обрабатывать их.
Алгоритмы генерации могут работать 24/7 и со стабильными результатами. В отличие от людей, которые отдыхают или могут совершать ошибки. Если у вас есть уже выстроенный pipeline в синтетике, то это проще и быстрее контролировать и допускать меньше ошибок в генерации датасетов.
Post #97
1.45K
- 👍 10
- 🔥 2