Grafana Labs 提出把可靠性工程里的错误预算(error budget)思路用到 AI Agent 上。延迟、token 数、错误率、工具调用链路这些常规信号都齐全,也回答不了最关键的问题:这个 Agent 到底好不好。一次响应可以 800 毫秒返回、几乎零成本、零报错,但内容自信流畅地全错。
做法是用评估(evaluation)直接量化行为:让一个裁判(通常是另一个语言模型)读一段对话、单条消息或一次工具调用并打分,判断是否有依据、是否完成用户请求、是否有毒、是否泄露个人信息、是否被提示注入攻破。有些检查甚至不需要模型,一条正则就能判断响应是否泄露了 API key。在 Grafana Cloud 的 Agent Observability 中,廉价的确定性检查和基于模型的裁判可以并存。
质量不是一个单一数字。有依据、完成度、毒性、延迟、成本是彼此独立失败的行为,应各给一个测量值,而不是追求一个混合准确率。裁判可按需校准:有时通过/失败就够,有时用 1 到 5 分制更合适,比如 4 分及以上算通过,最终得到一个可对标目标的比率。
光有数字不够。仪表盘上孤立的分数会让人对每次小波动过度反应,最后没人再看图。SLO 补上的正是决策:比如把「裁判判定为已完成的对话比例」设为 30 天内 95%。剩下的 5% 不是失败,而是预算——预算充足就放心试新提示词、换模型;预算见底就收一收新功能,先修质量。
真正要盯的是缓慢的静默漂移:单次对话都不刺眼,但每天流失一点质量,可能是提示词过时、模型升级对场景更差、用户需求变了。Agent 的回答即使漂移也依然流畅可信,简单阈值抓不住,预算能,因为它衡量的是累积而非某一刻。目标值也不必凭空猜:评估跑够样本后,可让 Grafana Assistant 基于分数推荐 SLO 目标并创建 SLO,再自行上调或下调。
