TGViewer
ПолитИИзация ПолитИИзация @aipolitics · 413 subscribers
Post #154 348
#aihow
ИИ требует все больше данных, но способен ли человек удовлетворить запросы машины?


Один из ключевых принципов ИИ - это обучение на данных и их обработка. К примеру, для обучения языковой модели GPT3 на момент релиза в 2020 году исследователи собрали набор данных из более 570 ГБ текстов, английскую Википедию, два датасета с книгами и датасет WebText2 с текстами веб-страниц.

Человек своей жизнью постоянно создает данные и, кажется, что их дефицита быть не может. Но готовы ли мы делиться информацией о своей жизни?

Технологические компании пытаются решить эту задачу через обезличивание данных, обещание использовать наши данные по определенным инструкциям. Однако чем дальше, тем сложнее реализовать эти обещания, ведь алгоритмы для улучшения своей работы требуют все больше данных.

Развитие же алгоритмов позволяет узнать чувствительную персональную информацию даже из обезличенных данных (вспомните случаи, когда злоумышленники соединили несколько украденных баз данных из разных сервисов, что позволило им идентифицировать конкретных людей).

Для решений этой проблемы компании используют синтетические (искусственно сгенерированные, имитируюрующие реальные) данные. Помимо вопроса персонализации, эти данные позволяют решать ряд других задач:
- Увеличение объема обучающих данных для машинного обучения, когда реальных данных недостаточно
- Создание сбалансированных наборов данных, если в реальных данных есть перекос
- Снижение затрат на сбор и разметку реальных данных

По оценкам аналитиков, к 2030 такие данные будут составлять больше 60% всех данных в мире. Неудивительно, что вокруг них уже формируется целый рынок, растущий по 30% от года к году (аналитики ждут $1.15 млрд к 2027 году)

На фоне всего этого можно явно сказать, что данных для ИИ хватит, но, возможно, мы подойдем к ситуации, в которой выдуманные данные начнут менять уже реальную жизнь человека.
  • 🔥 2
More from @aipolitics
  1. Sep 29, 2026😇Правда или bullshit? В эссе On Bullshit философ Гарри Франкфурт предложил различать ложь…
  2. Sep 6, 2026Напишет ли ООН правила для ИИ? Товарищи по осмыслению международного развития ИИ выпустили…
  3. Sep 1, 2026В рамках нашей студенческой лаборатории мы активно экспериментируем с ИИ инструментами. Я…
  4. Sep 1, 2026🎙 Дебаты нейросетей: должен ли ИИ платить налоги? Наш коллектив продолжает эксперименты с…
  5. Aug 28, 2026Написал статью о том, как мировой ИИ петляет между открытостью и закрытостью Ровно год наз…
  6. Aug 18, 2026Акционеры развития ИИ: почему прогресс не гарантирует больших благ Тайвань собирается выпл…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →