Artificial Analysis 对 xAI 的 Grok 4.6 进行了独立深度评测。结果显示,这款模型在 Agent 任务上表现尤为突出,同时在成本效率方面建立了显著优势。
Grok 4.6 在 AI 智能指数(九项基准测试的复合评分)中获得 61 分,较 Grok 4.5 提升 5 分,较 Grok 4.3 提升 23 分。评测的核心发现是:Grok 4.6 的 Agent 能力明显强于其静态推理能力,模型在多轮交互与工具调用场景下的表现更值得关注。
对关注模型选型的开发者来说,这意味着 Grok 4.6 在需要多步规划、工具调用的实际任务中可能比传统基准测试分数所暗示的更有价值;而成本效率上的优势,则让它在同等预算下能支撑更大规模的调用量。对于正在做 Agent 应用或对推理成本敏感的团队,这款模型值得纳入对比测试。
#GitHub #开源 #Grok #xAI #AI模型 #Agent #基准测试
@GitHubTrendingHub