TGViewer
开发者工具箱|编程·开发工具·资源 开发者工具箱|编程·开发工具·资源 @devtoolboxhub · 779 subscribers
Post #1471 4
10个LLM评估实验,只跑了1个——够了

作者设计了10个实验来回答一个问题:在日常开发中,什么时候需要前沿模型,什么时候只是在浪费钱?最终他只跑了1个CI诊断实验,结果就够用了。

实验对比了Haiku 4.5和Sonnet 5(通过OpenRouter),使用真实GitHub Actions日志,约50次run。结果:Haiku便宜10倍,快67%,准确率相当。对CI诊断这类任务,Haiku是默认选择,Sonnet只在必要时使用。整个实验花费$13.53。

作者还构建了可复用的评估框架model-compass,涵盖9个真实Agent任务(CI诊断、事故事件分类、代码审查、PR撰写、架构分析等),支持多模型适配层和成本自动计算。
同时提到了开源路由器TierForge,它能将评估证据转化为YAML路由规则,如“CI诊断默认用Haiku,满足特定条件升级到Sonnet”。
关键教训:不需要跑完所有实验,一个精心选定的实验就能校准直觉;评估框架比发布论文更有价值;个人预算决定了学习策略;成本问题背后常隐藏着信任、控制等深层担忧。


#开发者 #工具 #LLM #CI #Haiku #Sonnet #ModelCompass #TierForge #DevOps #成本优化
@DevToolboxHub
More from @devtoolboxhub
  1. Sep 27, 2026Instagram 字体生成器:把普通文字换成 Unicode 样式 Instagram 字体生成器是一类在线工具,把普通字母转换成外观不同的 Unicode 字符,再复制粘贴到…
  2. Sep 27, 2026用一个下午审计公司里的重复性工作 多数公司不需要耗时半年的转型项目,才能发现时间到底流失在哪里。花几个小时追踪三个真实工作流,就能看出很多问题。关键不是问团队哪里效率低,也不是凭记…
  3. Sep 27, 2026竞品关键词调研的自动化流程 从竞品差距分析导出两万个关键词,约一半只是同一词换了词序。真正的瓶颈在导出之后那一小时:一个好问题变成一堵近似重复词组成的墙,外加三种不同口径的搜索量。…
  4. Sep 26, 2026PostgreSQL 复制槽上限参数 max_replication_slots 解析 max_replication_slots 决定共享内存中复制槽数组的长度,仅此而已。它不决…
  5. Sep 26, 2026五仓库架构踩坑:Gitlink 与双 CI Flude 团队复盘了多仓库架构的实践代价。项目从第一分钟起就选择拆分成独立仓库,Pipeline、engine、design-docs…
  6. Sep 26, 2026Xeno Core:TypeScript 后端架构框架 Node.js 复杂系统的架构选型往往决定代码的长期命运。开发者常在两条路之间纠结:要么依赖重度使用实验性装饰器和反射(如…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →