Google 发布 VeriHarness 远景任务验证框架
Google 研究团队发布 VeriHarness,用生成候选结果的同一模型执行验证:对分歧主张核查环境证据,对共识主张主动挑战,并据此选择、修订或重建最终结果。
项目在 5 个长程任务基准、2 个模型上取得最高选择分;证据驱动修订后,较单次生成平均提升 Gemini 3.5 Flash 6.2 分、Claude Opus 4.8 6.4 分,并公开约 2.6 万条 rollouts。
arXiv | GitHub
Post #1558
1