Post #34970 284 Oct 4, 2026, 05:43 UTC 在 DSH 里面用一个公平的基线重新测了一遍各个模型,GLM 的表现是最差劲的,它有一个非常不好的习惯,遇到问题先猜,猜不中之后再猜,从来都不收集证据,最后猜到情绪崩溃就会搞出「烦」,「不猜了」然后继续猜。所以这个模型非常不适和解决复杂问题 🌚 9 🐳 2