ABC做了一组对照实验,实测三款顶尖大模型的预测上限。 实验直接锁死时间在今年2月底美以冲突爆发前,关掉Claude Opus 4.8、Grok 4.5、ChatGPT 5.6的联网,只给当时已公开信息。 在伊朗局势的14个问题里,AI猜对12个,准确率很高。
但换到体育赛事、黄金、比特币、石油、标普500这类场景,预测命中率连50%都达不到,不少判断完全相反。 结论很清晰:AI擅长依托已有信息做逻辑推演,却很难应对随机事件和人的突发决策。它适合推演决策带来的后果,而不是预判人的选择。
Post #5265
68