Post #34997 718 Oct 6, 2026, 00:48 UTC 我觉得现在 Agent Benchmark 缺几个很重要的项目:1. 压缩上下文的能力到底好不好(能不能整理出来不污染后续任务的上下文)2. 长上下文情况下的稳定性3. 量化之后的稳定性 🐳 8 🌭 2