И еще в свежем номере «Денег и кредита» вышел обзор семинара «Искусственный интеллект и экономика», в котором я участвовала летом. И он напомнил мне, что по мотивам этого семинара я написала небольшой пост, а на комментарии к нему в итоге не ответила. Исправляюсь!
Пост был про работу Александра Елисеева и Сергея Селезнева с идеей fake date test. Вопрос у них такой: если мы хотим проверить, насколько хорошо LLM могла бы прогнозировать экономику, скажем, в 2005 году, достаточно ли написать ей в промпте «сейчас 2005 год, не используй никакой информации из будущего»?
В комментариях возникло возражение: конечно, модель не может не использовать знания, зашитые в ее весах; кроме того, LLM стохастична, поэтому нормально получить разные ответы на один и тот же запрос. После обсуждения с более сведущими в этих вещах коллегами попробую уточнить, что здесь, кажется, было смешано.
Авторы не пытаются доказать, что в модели есть знание о будущем — оно есть, и они с этим не спорят. Они проверяют, удается ли с помощью инструкции получить исторический прогноз, не искаженный этим знанием. И стохастичность сама по себе этот тест не отменяет. Авторы сравнивают не два отдельных ответа модели, а распределения прогнозов, полученных при разных фиктивных датах. Случайный разброс генераций – одна история, а систематическое различие этих распределений – другая.
Поэтому точнее сказать, что работа проверяет не столько способность LLM прогнозировать вообще, сколько надежность ретроспективного прогнозирования при помощи модели, которая уже обучена на более поздней информации. В проведенных авторами тестах простого указания «тебе запрещено знать что-то после такой-то даты» оказалось недостаточно. Так что я бы сузила вывод прошлого поста: работа показывает, что хороший ретроспективный прогноз от современной LLM еще не означает, что она могла бы сделать такой прогноз в соответствующий момент времени в прошлом.
#любопытное_исследование
Post #993
109
- 🔥 5