Вкратце:
Студентам университета Беркли дали задания, связанные с прогнозированием разных событий, в духе «какой будет цена на нефть через шесть месяцев».
90% студентов действовали по принципу «скорми LLMке промпт, скопируй результат as is, сдай задание»; у этих на выходе получилась предсказуемая херня. Остальные 10% интенсивно тыкали LLM вилами – задавали дополнительные вопросы, подгружали новые данные, давали нестандартные вводные и пр.
И вот с этими 10% началось самое интересное.
Во-первых, прогнозы у них оказались не сильно хуже, чем у тех, кто зарабатывает миллионы долларов на Polymarket’е.
Во-вторых, качество получившихся прогнозов вообще не зависело от используемой модели: с т.з. точности одинаковый результат показывали и какой-нибудь самый новый Claude, и ущербные опенсорсные ИИ-модели для мобильных.
Ну то есть ребята на кошках продемонстрировали: единственный компонент, реально определяющий уровень / качество результата, который выдают LLMки для массового потребителя, – это человек с его навыками, в первую очередь – с навыками [нестандартного] мышления и, простите, со встроенным исследовательским любопытством.
А бенчмарки и количество параметров в моделях, которыми на публику меряются ИИ-вендоры, – это, в большинстве случаев, чистой воды маркетинг и продаванство.
(на всяк случ: речь именно что о массовых чатботах, а не о специализированных / нишевых моделях)
#ИИ