大语言模型的 Scaling:扩展方向、收益规律与训练配置
大语言模型的 Scaling:扩展方向、收益规律与训练配置 Scaling laws 的核心价值,是估计扩大模型与训练量的收益,并在计算预算内找到更好的配比。 它把“投入更多资源通常能降低损失”的经验,变成可以测量、拟合和检验的关系。这里的主要质量指标是语言建模交叉熵;具体任务是否改善,还要单独评估
cnblogs.com • Oct 4, 2026
Post #3904
3

博客 博客园 - 开发者的网上家园 @cnblogs_com · 136 subscribers 