#aihow
ИИ требует все больше данных, но способен ли человек удовлетворить запросы машины?
Один из ключевых принципов ИИ - это обучение на данных и их обработка. К примеру, для обучения языковой модели GPT3 на момент релиза в 2020 году исследователи собрали набор данных из более 570 ГБ текстов, английскую Википедию, два датасета с книгами и датасет WebText2 с текстами веб-страниц.
Человек своей жизнью постоянно создает данные и, кажется, что их дефицита быть не может. Но готовы ли мы делиться информацией о своей жизни?
Технологические компании пытаются решить эту задачу через обезличивание данных, обещание использовать наши данные по определенным инструкциям. Однако чем дальше, тем сложнее реализовать эти обещания, ведь алгоритмы для улучшения своей работы требуют все больше данных.
Развитие же алгоритмов позволяет узнать чувствительную персональную информацию даже из обезличенных данных (вспомните случаи, когда злоумышленники соединили несколько украденных баз данных из разных сервисов, что позволило им идентифицировать конкретных людей).
Для решений этой проблемы компании используют синтетические (искусственно сгенерированные, имитируюрующие реальные) данные. Помимо вопроса персонализации, эти данные позволяют решать ряд других задач:
- Увеличение объема обучающих данных для машинного обучения, когда реальных данных недостаточно
- Создание сбалансированных наборов данных, если в реальных данных есть перекос
- Снижение затрат на сбор и разметку реальных данных
По оценкам аналитиков, к 2030 такие данные будут составлять больше 60% всех данных в мире. Неудивительно, что вокруг них уже формируется целый рынок, растущий по 30% от года к году (аналитики ждут $1.15 млрд к 2027 году)
На фоне всего этого можно явно сказать, что данных для ИИ хватит, но, возможно, мы подойдем к ситуации, в которой выдуманные данные начнут менять уже реальную жизнь человека.
Post #154
348

- 🔥 2