Насколько LLM хороши в оценках вероятностей и прогнозах? Чтобы ответить на этот вопрос теперь есть Prophet Arena. Они тестируют модели на способность и эффективность в прогнозах реальных событий — и собирают бенчмарки.
На самом деле они конечно не единственные кто это делает. Еще есть ForecastBench, FutureBench, MIRAI, и тд.
Но на Prophet Arena LLM должны выдавать конкретные вероятности своих прогнозов (и это какое-то ноу-хау). Подробнее можно почитать в их блоге. Я сделал по этому тексту аудио-саммари.
Это еще и хороший повод порассуждать, а смогут ли LLM теперь классно спрогнозировать про будущее работы и HR?
Когда-нибудь мы должны были сказать это вслух: нет, не смогут — потому что никто не сможет.
Чтобы качественно описать как будет выглядеть будущее чего-то сложного и динамичного, нам нужно это операционализировать.
У этого чего-то должны быть индикаторы и метрики, стационарность условий, и экзогенность.
Построить модель, в которой динамику можно представить конкретными индикаторами — с этим легче. Например, изменения количества вакансий, резюме, зарплат. Но это скучно. Потому что там нет повествовательного содержания и эмоций.
А там где есть сюжет и яркие образы — это уже не совсем прогноз. Да, сторителлинг поможет нам интегрировать отдельные элементы в живую убедительную картину. И это можно будет назвать интересным предположением. Но хорошим реалистичным прогнозом — вряд ли.
Post #2652
2.33K

- 👍 6
- 🔥 4
- ❤ 1