Один из ключевых навыков современного мира - умение проверять данные.
Сегодня принесла вам пару примеров из разных областей и своё личное мнение о том, как будут развиваться события.
1️⃣ Есть замечательный сайт https://weatherspark.com/ Он даёт возможность сравнить погоду в разных городах. Я им пользовалась при выборе места жительства, многие на него ссылаются как неоспоримый аргумент в споре о том, где климат лучше. Недавно я осознала неочевидную вещь: данные на сайте обрезаны 2016 годом. Т.е. последние 9 лет не вошли в рассчёт.
Это важная информация. Потому что если заглянуть в другие источники, то становится заметно, что за последнее десятилетие среднегодовая температура существенно поднялась, а отклонение от тридцатилетнего среднего по температуре в плюс стали случаться чаще и сильнее.
2️⃣ "Vegetative electron microscopy" звучит как сложный научный термин, но это просто ошибка: результат склейки слов при сканировании статьи и неверного перевода с фарси. Термин не имеет смысла, но его публиковали в реальных "научных" статьях, а нейросети до недавних пор уверенно выдавали информацию о нём.
3️⃣ Я часто рисёрчу для рабочих задач аналитику по сторонним сервисам, бенчмарки, тренды. И несколько раз попадала в ловушку: брала данные, которые были похожи на то, что мне нужно, с ангажированных источников. Грубый пример, данные по зарплатам джуниор разаработчиков с сайта буткемпа для разработчиков. С появлением нейросетей и deep research такие ошибки стало сделгать гораздо проще, т.к. в ответе на вопрос нейросети часто выдают желаемое за действительное, анекдотические свидетельства за правило, с одного коммерческого сайта, продающего рассрочку, выдирают все ответы на запрос "нужна ли пользователям рассрочка". Если не проверять, можно серьёзно проколоться.
🧙♀️То, что я вижу сейчас, заставляет меня думать о том, что с ростом числа статей, сгенерированных нейросетями и опубликованных в "приличных" местах, мы упрёмся в проблему отсутствия каких-либо достоверных данных. В интернете и раньше было полно фейков. Но сейчас производить, переписывать на разные голоса и распространять их стало гораздо дешевле и проще. И ведь новые поколения нейросетей будут учить на новых данных. Созданных местами крайне сомнительными способами.
👉 Поэтому, как мне кажется, будет расти спрос на людей, которые умеют разбираться в источниках и строить системы контроля за качеством данных — Data Governance.
Post #92
701
- 💯 9
- ❤ 2
- 😨 1