作者设计了10个实验来回答一个问题:在日常开发中,什么时候需要前沿模型,什么时候只是在浪费钱?最终他只跑了1个CI诊断实验,结果就够用了。
实验对比了Haiku 4.5和Sonnet 5(通过OpenRouter),使用真实GitHub Actions日志,约50次run。结果:Haiku便宜10倍,快67%,准确率相当。对CI诊断这类任务,Haiku是默认选择,Sonnet只在必要时使用。整个实验花费$13.53。
作者还构建了可复用的评估框架model-compass,涵盖9个真实Agent任务(CI诊断、事故事件分类、代码审查、PR撰写、架构分析等),支持多模型适配层和成本自动计算。
同时提到了开源路由器TierForge,它能将评估证据转化为YAML路由规则,如“CI诊断默认用Haiku,满足特定条件升级到Sonnet”。
关键教训:不需要跑完所有实验,一个精心选定的实验就能校准直觉;评估框架比发布论文更有价值;个人预算决定了学习策略;成本问题背后常隐藏着信任、控制等深层担忧。
#开发者 #工具 #LLM #CI #Haiku #Sonnet #ModelCompass #TierForge #DevOps #成本优化
@DevToolboxHub
