На «Макромастерской» в Казани я говорил про ДКП и экономический рост. Но об этом в моём исполнении уже можно послушать по ссылке в предыдущем посте. Здесь — о прогнозировании.
Мне кажется важной мысль, которую на круглом столе по ИИ высказал Александр Исаков: при использовании генеративных моделей искусственного интеллекта для построения прогнозов возникает серьёзная методологическая проблема.
Она состоит в том, что для таких моделей фактически не существует тестовой выборки.
Как мы обычно проверяем качество прогноза в машинном обучении или эконометрике? Мы делим данные на обучающую выборку (например, 2014–2023 годы) и тестовую выборку (например, 2024–2025 годы).
Сначала оцениваем параметры модели на обучающей выборке, не «показывая» ей тестовые данные. Затем смотрим, насколько хорошо модель предсказывает, что произойдет с прогнозируемой переменной 2024-2025 году. И сравниваем модельный прогноз с фактическими данными. Это называется процедурой псевдовневыборочного прогнизрования. По сути, это единственный честный способ проверить, способна ли модель предсказывать неизвестное ей будущее, а не просто хорошо описывать прошлое.
Проблема в том, что генеративные модели ИИ обучены на огромных массивах данных из интернета. Мы не можем гарантированно «скрыть» от них тестовую выборку. Всё, что известно о данных нам, потенциально известно и модели. Даже если мы попросим её не «подглядывать» в статистику 2024–2025 годов — и даже если она формально пообещает этого не делать, — у нас нет способа проверить, что она не жульничает. Такие модели остаются чёрным ящиком.
Поэтому к заявлениям о том, что большие языковые модели превосходят традиционные методы ML или эконометрику в прогнозировании, стоит относиться осторожно. Убедительность таких утверждений определяется тем, в какой мере авторы смогли решить описанную проблему.
Post #63
1.57K



- 👍 63
- 🤝 13
- 💅 2
- ❤ 1
- 🗿 1