Многие уже слышали про новую статью Сбера с провокационным названием, которое намекает о том, что "они научились предсказывать будущее": HoTPP benchmark: Are we good at the long horizon events forecasting?
Нам этот вопрос близок и мы делали в прошлом году три обзора про прогнозирование моды, катастроф и покупок на маркетплейсах. Сегодня посмотрим, что нового говорят эксперты Сбера.
Корпоративные исследователи Сбера предложили открытый бенчмарк HoTPP и метрику T-mAP для оценки долгосрочного прогноза событий сразу по двум параметрам: что именно произойдет и когда именно это произойдет. Причем речь идет не об игрушечных датасетах, а наших с вами данных: в финансах, e-commerce и медицине — областях, где точность прогноза быстро превращается в деньги, а неверное решение — в потерянного клиента.
Возможно, самая ценная сторона этой работы — её антихайповость. Сбер показывает, что более сложные нейросетевые архитектуры не всегда предсказывают долгосрочные события лучше, чем простые статистические методы, хотя GPU-оптимизация ускоряет обучение и инференс в десятки раз.
То есть сегодня важен уже не только размер модели, а то, как именно мы измеряем качество прогноза и не путаем ли вычислительную мощь с реальной способностью видеть будущее.
Но Сбер не одинок в этих попытках. Все ИИ-разработчики идут в сторону прогнозов. И чем лучше нейросети предсказывают будущее, тем труднее понять, где заканчивается полезная рекомендация и начинается управление человеком. Потому что заказчиков на такой прогноз уже слишком много: маркетплейсы хотят знать, что мы купим завтра, работодатели — кто выгорит или уволится, политические штабы — как сдвинуть настроение групп, а цифровые сервисы в целом — какой сигнал, стимул или интерфейс подтолкнет нас к "нужному" действию.
Например, обратим ваше внимание на бенчмарк FutureBench от HuggingFace. Они проверяют не абстрактное знание модели о прогнозах, а способность агентно собирать свежий контекст, учитывать время и строить прогноз по еще не завершившимся событиям. Это уже очень близко к тому, как подобные системы будут применяться в политике, бизнесе, медиа и безопасности.И все потому что современные ИИ-агенты все чаще строятся вокруг доступа к актуальному пользовательскому контексту: письмам, календарю, задачам, документам и рабочим материалам.
Это означает, что модель пользователя становится не просто "анкетой", а постоянно обновляемым цифровым двойником, и именно здесь рациональная рекомендация легко превращается в механизм подталкивания.
Для разработчиков при этом остаются тяжелые нерешенные проблемы: постоянное изменение среды пользователей и целей, наличие обратной связи типа "прогноз меняет поведение", слабая калибровка вероятностей, риск того, что бенчмарк награждает не точность, а удачную игровую стратегию, и тот факт, что коллективная экспертиза людей иногда все еще устойчивее отдельной модели.
💬 Тест Тьюринга. События в сфере ИИ. Подписаться
