TGViewer
开发者工具箱|编程·开发工具·资源 开发者工具箱|编程·开发工具·资源 @devtoolboxhub · 780 subscribers
Post #1879 2
用 SLO 给 AI Agent 的行为定个预算

Grafana Labs 提出把可靠性工程里的错误预算(error budget)思路用到 AI Agent 上。延迟、token 数、错误率、工具调用链路这些常规信号都齐全,也回答不了最关键的问题:这个 Agent 到底好不好。一次响应可以 800 毫秒返回、几乎零成本、零报错,但内容自信流畅地全错。
做法是用评估(evaluation)直接量化行为:让一个裁判(通常是另一个语言模型)读一段对话、单条消息或一次工具调用并打分,判断是否有依据、是否完成用户请求、是否有毒、是否泄露个人信息、是否被提示注入攻破。有些检查甚至不需要模型,一条正则就能判断响应是否泄露了 API key。在 Grafana Cloud 的 Agent Observability 中,廉价的确定性检查和基于模型的裁判可以并存。
质量不是一个单一数字。有依据、完成度、毒性、延迟、成本是彼此独立失败的行为,应各给一个测量值,而不是追求一个混合准确率。裁判可按需校准:有时通过/失败就够,有时用 1 到 5 分制更合适,比如 4 分及以上算通过,最终得到一个可对标目标的比率。

光有数字不够。仪表盘上孤立的分数会让人对每次小波动过度反应,最后没人再看图。SLO 补上的正是决策:比如把「裁判判定为已完成的对话比例」设为 30 天内 95%。剩下的 5% 不是失败,而是预算——预算充足就放心试新提示词、换模型;预算见底就收一收新功能,先修质量。

真正要盯的是缓慢的静默漂移:单次对话都不刺眼,但每天流失一点质量,可能是提示词过时、模型升级对场景更差、用户需求变了。Agent 的回答即使漂移也依然流畅可信,简单阈值抓不住,预算能,因为它衡量的是累积而非某一刻。目标值也不必凭空猜:评估跑够样本后,可让 Grafana Assistant 基于分数推荐 SLO 目标并创建 SLO,再自行上调或下调。
More from @devtoolboxhub
  1. Sep 26, 2026五仓库架构踩坑:Gitlink 与双 CI Flude 团队复盘了多仓库架构的实践代价。项目从第一分钟起就选择拆分成独立仓库,Pipeline、engine、design-docs…
  2. Sep 26, 2026Xeno Core:TypeScript 后端架构框架 Node.js 复杂系统的架构选型往往决定代码的长期命运。开发者常在两条路之间纠结:要么依赖重度使用实验性装饰器和反射(如…
  3. Sep 25, 2026Xcode 27.2 改用 JSON 项目格式 Xcode 27.2 用基于 JSON 的 project.xcproj 取代了沿用多年的 project.pbxproj。新建项目…
  4. Sep 25, 2026PostgreSQL 的 max_prepared_transactions 该不该开 prepared transaction 是脱离会话独立存在的两阶段提交事务。执行 PREP…
  5. Sep 24, 2026RPI 实战:用 Claude Code 子代理拆分研发流程 一个约十几个产品的小团队(helpdesk、MES、邮件托管、高校 AI 助手)在 monorepo 里日常使用 Cl…
  6. Sep 24, 2026云原生架构下的依赖模拟工具问题 当前主流依赖模拟工具并非针对云原生架构设计。这些工具诞生于服务有固定发布周期、上游依赖变更缓慢且明确、测试团队可清晰掌握依赖行为的时代,而云原生架构…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →