一位开发者运营的公测面板每天对16个模型执行35项固定任务,并记录每次得分。当模型分数下降时,它会自动创建GitHub issue并生成草稿。7月21日至24日,该工具触发了4次回归警报,但全部为误报——没有模型真正变差。
两次误报源于API调用失败:Gemini 3.5 Flash 和 Gemini 3.1 Pro 在触发警报时,准确率与可靠性(调用成功率)同步下降。可靠性从1.000降至0.914,说明约9%的探测调用未返回结果,未评分的任务等同于错误。后续干净运行显示Gemini 3.1 Pro得分回升至97.1%,高于“回归”前。
另外两次误报则揭示了测试套件的粒度限制:Grok 4.3 下降5.7分,Llama 3.3 70B 下降2.9分,可靠性始终为1.000。35项任务中每项占约2.86分,2.9分正好是一道题的变化,5.7分是两道题。用35题套件无法分辨3分以内的差异,单道题翻转被误读为模型回归。
作者强调,自动化敏感度是功能,但必须有人工检查环节。该工具的警报不直接发布,仅生成草稿,提醒检查运行日志和可靠性指标。本周4次通知,0次发布。作者认为真正有用的指标是存活警报的比例——本周为0,这也暴露了套件过小与缺乏可靠性指标的问题。
面板与代码已开源:github.com/egnaro9/model-drift
#开发者 #工具 #LLM #漂移检测 #模型测试 #可靠性 #误报 #GitHub #自动化 #DevOps
@DevToolboxHub
