TGViewer
Big Data Science [RU] Big Data Science [RU] @bdscience_ru · 1.62K subscribers
Post #131 423
📝Анализ данных временных рядов: 5 советов Data Scientist’у
Одна из самых распространенных ошибок в анализе данных временных рядов, которую совершают новички – это предположение, что данные имеют регулярные точки и не содержат пропусков. На практике это обычно не подтверждается и приводит к неверным результатам. В реальных датасетах часто отсутствуют точки данных, а имеющиеся расположены неравномерно или непоследовательно. Поэтому перед анализом данных временных рядов следует провести этап предварительной подготовки:
• Понять временной диапазон и детализацию временного ряда по точкам данных с помощью визуализации датасета;
• Сравнить фактическое количество тактов в каждом временном ряду с количеством ожидаемых тактов в зависимости от интервала между точками и общей длины временного ряда. Это соотношение иногда называют коэффициентом заполнения, равным разнице между максимальной и минимальной временной меткой, деленной на интервал между точками. Если это значение намного меньшее 1, то пропущено очень много данных.
• Отфильтровать серии с низким коэффициентом заполнения, установив ограничение, например, в 40% или то, что подходит для конкретной задачи.
• Стандартизировать интервал между отметками во временных рядах за счет повышения дискретизации до более детального разрешения.
• Заполнить пропуски с повышенной дискретизацией, используя соответствующий метод интерполяции, например, на основе последнего известного значения или линейной/квадратичной интерполяции. В Apache Spark для этого можно использовать метод applyInPandas в сгруппированном датафрейме PySpark, под капотом которого pandasUDF, производительность которой намного выше простых UDF-функций за счет более эффективной передачи данных через Apache Arrow и вычислений через векторизацию Pandas.
https://towardsdatascience.com/a-common-mistake-to-avoid-when-working-with-time-series-data-eedf60a8b4c1
Medium How NOT to Analyze Time Series One of the most common time series data mistakes I see junior data scientists and interview candidates make is to assume that the data has…
More from @bdscience_ru
  1. Oct 1, 2026Перезапуск Microsoft Copilot как «суперприложения» Компания Microsoft официально представи…
  2. Sep 25, 2026Распознавание экрана (Onscreen Awareness) Siri научилась понимать, что происходит у вас на…
  3. Sep 15, 2026Reuters раскрыло инцидент со скоординированными действиями ИИ-агентов OpenAI: Расследовани…
  4. Aug 31, 2026Самая ужасная гавайская рубашка Немецкий дизайнер Симон Веккерт разработал гавайскую рубаш…
  5. Aug 25, 2026WeatherNext от Google DeepMind совершил прорыв в метеорологии! Новый ИИ прогнозирует тропи…
  6. Aug 15, 2026🧠 Enterprise AI наконец-то перестал быть «чатиком сбоку» OpenAI опубликовали два исследов…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →