TGViewer
Big Data Science [RU] Big Data Science [RU] @bdscience_ru · 1.62K subscribers
Post #140 467
📚Введение в разработку фичей для прогнозирования временных рядов - отрывок из книги доктора Francesca Lazzeri «Машинное обучение для прогнозирования временных рядов с помощью Python» (Machine Learning for Time Series Forecasting with Python), опубликованной в декабре 2020 года

Разработка ML-моделей часто занимает много времени и требует учета множества факторов: повторение алгоритмов, настройка гиперпараметров и feature engineering. Эти варианты дополнительно умножаются на данные временных рядов, поскольку DS-специалисты должны еще учитывать тенденции, сезонность, праздники и внешние экономические переменные. Каждый ML-алгоритм ожидает данные в качестве входных данных, которые должны быть отформатированы. Поэтому наборы данных временных рядов требуют предварительной очистки и определения фичей, прежде чем запустить моделирование.
Особенность анализа временных рядов в том, что точки данных привязываются ко времени. Например, необходимо построить выходные данные ML-модели, определив переменную, которую необходимо предсказать (будущее количество продаж в следующий понедельник), а затем использовать исторические данные и набор фичей для создания входных переменных. Это нужно для достижения следующих целей:
• создание корректного набора входных данных для ML-алгоритма, чтобы создать входные фичи из исторических данных и сформировать датасет как задачу контролируемого обучения;
• повышение производительности ML-моделей – создание действительных отношений между входными фичами и целевой переменной, которую необходимо прогнозировать.
Основными категориями данных, полезных для анализа временных рядов, являются следующие:
• Дата и время - фичи на основе значения отметки времени каждого наблюдения, например, часы, месяц и день недели для каждого наблюдения. Сюда же относятся выходные и праздники, время года и пр.
• Запаздывание - значения на предыдущих временных шагах, которые считаются полезными, потому что они созданы на основе предположения, что то, что произошло в прошлом, может влиять или содержать своего рода внутреннюю информацию о будущем. Например, может быть полезно создавать функции для продаж, которые произошли в предыдущие дни в 16:00, если нужно предсказать аналогичные продажи в это же время на следующий день.
• Статистика скользящего окна, чтобы вычислить статистику по значениям из заданной выборки данных путем определения диапазона, который включает сам выборку, а также некоторое заданное количество значений до и после используемой выборки.
• Статистика расширяемого окна из фичей, которые включают все предыдущие данные.
Посмотреть иллюстрации и примеры Python-функций можно здесь: https://medium.com/data-science-at-microsoft/introduction-to-feature-engineering-for-time-series-forecasting-620aa55fcab0
Medium Introduction to feature engineering for time series forecasting Transforming raw data to prepare it for use in ML algorithms to discover insights and, eventually, make predictions.
More from @bdscience_ru
  1. Oct 1, 2026Перезапуск Microsoft Copilot как «суперприложения» Компания Microsoft официально представи…
  2. Sep 25, 2026Распознавание экрана (Onscreen Awareness) Siri научилась понимать, что происходит у вас на…
  3. Sep 15, 2026Reuters раскрыло инцидент со скоординированными действиями ИИ-агентов OpenAI: Расследовани…
  4. Aug 31, 2026Самая ужасная гавайская рубашка Немецкий дизайнер Симон Веккерт разработал гавайскую рубаш…
  5. Aug 25, 2026WeatherNext от Google DeepMind совершил прорыв в метеорологии! Новый ИИ прогнозирует тропи…
  6. Aug 15, 2026🧠 Enterprise AI наконец-то перестал быть «чатиком сбоку» OpenAI опубликовали два исследов…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →