TGViewer
开发者工具箱|编程·开发工具·资源 开发者工具箱|编程·开发工具·资源 @devtoolboxhub · 779 subscribers
Post #1532 9
RAGAS 与 DeepEval 对同一编造回答给出 0 分和满分

一份 RAG 系统输出声称了上下文从未给出的定价信息。作者用两个最流行的 LLM-as-judge 忠实度指标各测五次,gpt-4o 温度 0。RAGAS 给出 0.000,DeepEval 给出 1.000,五次重复一致,并解释“实际输出与检索上下文之间没有矛盾”。两个指标都叫 faithfulness,只有其中一个发现了编造。

作者为医疗 AI 工具构建了 OpenGATE,所有检查都是输出与人工标注金标的纯函数:要求事实必须出现、数字必须可追溯、上下文无法回答时必须弃权。随后与 RAGAS 和 DeepEval 做了对照实验。

实验使用 27 个冻结输出,包含生产系统输出和注入单一已知缺陷的突变体。缺陷按范围分组,检测以注入缺陷后的反应相对于未突变输出来衡量,且输出必须在每次重复中都被标记才算检出。

法官模型在语义反转上胜出:RAGAS 捕获 4/5,DeepEval 捕获 5/5,确定性检查捕获 0/5。但在遗漏上失败:缺失的抗生素剂量不构成矛盾,法官模型捕获 0/5 和 1/5,确定性锚点检查捕获 5/5。成本方面,RAGAS 每千次评估 11.49 美元,DeepEval 8.29 美元,确定性检查免费。速度上,法官模型每次重复 194 和 119 秒,确定性检查 3.8 毫秒。定位上,确定性检查会命名失败原因,RAGAS 返回标量,DeepEval 的推理有时好有时是“没有矛盾”。

定义性差异是关键:RAGAS 问“每个声明是否都有上下文支持”,DeepEval 的 faithfulness 问“是否有声明与上下文矛盾”。编造的数字不矛盾任何内容,因此在六个输出中 RAGAS 捕获 5 个,DeepEval 捕获 0 个。团队若未阅读实现就采用 LLM-as-judge faithfulness,等于无意中选择了对哪种失败模式视而不见。

在 gpt-4o 温度 0 下,法官模型稳定性尚可,但 gpt-4o-mini 上 11/27 输出在重复间改变判定。不将构建门控放在法官模型上的理由在于遗漏盲区、定义分歧和成本,这些都不是更好的法官模型能修复的。

确定性门控在生产中捕获了:静默解析失败导致约 50% 的多声明判定默认为“不支持”;去标识引擎的两个名称捕获 bug;简化器从出院小结中删除抗生素剂量。几个月后,同一系统产生了编造的血红蛋白数值,因为之前的提示修复只禁止遗漏数字,未禁止编造数字。


作者建议两者并用:LLM 法官处理语义,确定性检查作为门控。确定性检查 MIT 许可,一行命令运行,无需 API 密钥。

Repo: github.com/nickjlamb/opengate · Paper: doi.org/10.5281/zenodo.21365095

#开发者 #工具 #RAGAS #DeepEval #OpenGATE #LLMJudge #Faithfulness #RAG #AITesting
@DevToolboxHub
More from @devtoolboxhub
  1. Sep 27, 2026竞品关键词调研的自动化流程 从竞品差距分析导出两万个关键词,约一半只是同一词换了词序。真正的瓶颈在导出之后那一小时:一个好问题变成一堵近似重复词组成的墙,外加三种不同口径的搜索量。…
  2. Sep 26, 2026PostgreSQL 复制槽上限参数 max_replication_slots 解析 max_replication_slots 决定共享内存中复制槽数组的长度,仅此而已。它不决…
  3. Sep 26, 2026五仓库架构踩坑:Gitlink 与双 CI Flude 团队复盘了多仓库架构的实践代价。项目从第一分钟起就选择拆分成独立仓库,Pipeline、engine、design-docs…
  4. Sep 26, 2026Xeno Core:TypeScript 后端架构框架 Node.js 复杂系统的架构选型往往决定代码的长期命运。开发者常在两条路之间纠结:要么依赖重度使用实验性装饰器和反射(如…
  5. Sep 25, 2026用 SLO 给 AI Agent 的行为定个预算 Grafana Labs 提出把可靠性工程里的错误预算(error budget)思路用到 AI Agent 上。延迟、token…
  6. Sep 25, 2026Xcode 27.2 改用 JSON 项目格式 Xcode 27.2 用基于 JSON 的 project.xcproj 取代了沿用多年的 project.pbxproj。新建项目…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →