一项针对 10 款主流 AI 模型的基准测试显示,让大模型评审测试用例文档时,90% 的模型只会做表面总结,仅 Kimi K3 真正打开脚本与报告进行实证审计。
测试背景是某团队将 HMS 迁移至 AWS 的工程,包含 559 个批处理任务、150 个 Python 脚本、67 个应用及 Pester 迁移流水线,共四套测试文档。多数模型仅阅读标题与目录便生成结构化摘要,未核实文档中的数字是否自洽、文件是否真实完成、代码与文档描述是否一致。
Kimi K3 以 9.8/10 分大幅领先,发现四类关键问题:581 个禁用任务被误记为 FAIL 造成回归误报;部分应用文档仍是含占位符的模板;文档声明的 IT-04 场景在测试脚本中缺失;同一套件内任务数存在 559/617/629 三处矛盾。MiniMax-M3 与 Claude Sonnet 4 分列二三名,前者给出四层统一测试路线图,后者提供九维度对比矩阵。
完整排名:Kimi K3 9.8、MiniMax-M3 9.1、Claude Sonnet 4 8.7、Claude Opus 4 8.4、GLM-5.2 8.1、Gemini Pro 7.8、Qwen3.7 Plus 7.5、DeepSeek V4 Pro 7.2、Hy3 6.8、MiMo V2.5 Pro 6.2。
对工程团队的启示:提示词应明确要求模型对照实际文件核实声明,而非信任文档表面;不应以用例数量评判测试套件价值,需按其在测试金字塔中的层级评估;云迁移应构建四层测试生态,覆盖流水线、基础设施、技术断言与业务逻辑。
#开发者 #工具 #AI评测 #KimiK3 #MiniMaxM3 #ClaudeSonnet4 #测试文档 #Pester #AWS迁移 #CICD
@DevToolboxHub
