TGViewer
开发者工具箱|编程·开发工具·资源 开发者工具箱|编程·开发工具·资源 @devtoolboxhub · 780 subscribers
Post #1631 7
用 30 条安全通告实测模型判级准确率

一位开发者因模型把 critical 误判为 low,决定搭建一套可复现的准确率测试。他基于 30 条人工核对过的通告记录,让模型提取包名、严重级别和处置动作,并分别统计误报与漏报。测试脚本很短,读取 JSONL 文件,调用仅返回 JSON 的接口,再与期望值比对。

一次本地运行示例显示:critical 召回率 0.90,moderate 召回率 0.62。模型能抓住多数高危通告,但常把 moderate 降级为 low。作者指出,漏报比误报更危险——跳过关键升级的代价远高于一次多余审查。

测试暴露三类反复出现的失败模式:厂商用词不一致("important" 被映射为 moderate)、包名冲突(libxml2 被识别为 libxml)、长通告截断导致修复版本信息丢失。

作者明确不建议让该输出自动开合并请求,只用于人工复核前的分诊。需要审计级报告、升级工具无人复核或涉及合规系统时,不应采用此方案。建议从十条记录起步,人工标注期望值,先观察错误模式是否稳定再扩大规模。


这套方法的价值在于可复现:用固定测试集而非实时通告,避免厂商页面和模型行为变化影响结果。先度量,再信任。

#开发者 #工具 #安全通告 #AI评测 #Python #DevOps #依赖管理
@DevToolboxHub
More from @devtoolboxhub
  1. Sep 26, 2026PostgreSQL 复制槽上限参数 max_replication_slots 解析 max_replication_slots 决定共享内存中复制槽数组的长度,仅此而已。它不决…
  2. Sep 26, 2026五仓库架构踩坑:Gitlink 与双 CI Flude 团队复盘了多仓库架构的实践代价。项目从第一分钟起就选择拆分成独立仓库,Pipeline、engine、design-docs…
  3. Sep 26, 2026Xeno Core:TypeScript 后端架构框架 Node.js 复杂系统的架构选型往往决定代码的长期命运。开发者常在两条路之间纠结:要么依赖重度使用实验性装饰器和反射(如…
  4. Sep 25, 2026用 SLO 给 AI Agent 的行为定个预算 Grafana Labs 提出把可靠性工程里的错误预算(error budget)思路用到 AI Agent 上。延迟、token…
  5. Sep 25, 2026Xcode 27.2 改用 JSON 项目格式 Xcode 27.2 用基于 JSON 的 project.xcproj 取代了沿用多年的 project.pbxproj。新建项目…
  6. Sep 25, 2026PostgreSQL 的 max_prepared_transactions 该不该开 prepared transaction 是脱离会话独立存在的两阶段提交事务。执行 PREP…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →