Post #2641
731
Forwarded from 知乎大巴扎
Telegraph LLM(大语言模型)无法对数字进行准确运算的底层原因是什么? X上之前有个帖子(链接)专门测试了推理模型的多位数乘法。核心结论是在一直到20x20的乘法任务上测试了"o1-mini"模型。一直到9x9都很不错,而GPT-4o在超过4x4的乘法上就开始不行了。然而在高位数乘以高位数的区域,正确率很快降至0。 这篇文章比较系统的研究了这个问题(链接)。他们训练模型来研究三个组合推理任务:乘法、动态规划,以及一个被称为爱因斯坦谜题的任务。根据这些任务组合性质,他妈呢可以在复杂度可控的情况下进行模型研究,例如,比较2 x 2乘法与10 x 10乘法。 他们以SFT(监督微…