TGViewer
Readhub Readhub @readhub_cn · 8.51K subscribers
Post #356048 47
RSI 火了,但自进化也会过拟合:Google 等提出 RRSI,给自进化施加正则化

当前 Agent 领域的递归式自我改进(RSI)已有现实落地路径:无需修改模型权重,Agent 可通过迭代调整 Prompt、工具调用规则、记忆管理等外围 Harness 组件形成自我改进闭环。但传统无约束的 Harness 进化过程反复使用同一组任务迭代优化,易出现基准拟合、追逐评估噪声、复杂度累积三类问题,导致进化集分数持续上涨,但在未见过的 OOD 任务上收益大幅缩水,还会推高推理成本。谷歌提出的正则化递归自我改进框架 RRSI 不限制 Agent 的自我修改空间,而是从提案端限制单轮修改复杂度、留存完整进化历史引导探索,从筛选端严格验证修改的泛化性、性价比,过滤无效改动。实验显示,RRSI 在进化集分数略低于无约束进化的情况下,在多类未参与进化的 OOD 基准上表现更优,同时大幅降低推理 Token 消耗,30 轮进化中仅约三分之一的改动被验证有效并留存。该研究指出 RSI 的核心不应是追求无限制的自我修改,而是要实现可泛化的自我改进,让 Agent 能筛选出真正具备普适性的有效进步。

媒体报道
RSI 火了,但自进化也会过拟合:Google 等提出 RRSI,给自进化施加正则化 机器之心

事件追踪
2026-10-06 RSI 火了,但自进化也会过拟合:Google 等提出 RRSI,给自进化施加正则化
2026-09-14 谷歌 DeepMind 疑似实现 RSI 引发行业热议

#热门话题
More from @readhub_cn
  1. Oct 6, 2026清华团队开源可验证推理模型 VeriLoop E2 前沿大模型高速演进背景下,新增计算并不必然带来可验证的真实进展,针对这一结构性缺口,相关团队发布开源模型 VeriLoop E2…
  2. Oct 6, 2026Meta、微软削减 Claude 使用规模 控制 Token 支出并转向自家 AI 工具 Anthropic 冲刺 IPO 的关键阶段,其重要客户 Meta 和微软正收紧 Clau…
  3. Oct 6, 2026美联储理事鲍曼:拟重塑银行监管体系 重新评估更严监管资产门槛 美联储计划全面调整美国银行监管体系,将现行由各地区联储银行行长负责监督银行检查的模式,改为对华盛顿总部承担更明确责任的…
  4. Oct 6, 2026ASOS 确认遭遇网络安全事件 ASOS 确认遭遇网络安全事件,基本个人信息或遭泄露,支付卡信息未受影响,目前正调查涉及第三方客户平台的未经授权活动。 媒体报道 ASOS hack…
  5. Oct 6, 2026英伟达股价创历史新高 距 6 万亿美元市值关口仅一步之遥 英伟达盘初一度涨近 2%,报 243.37 美元,再创历史新高,市值达 5.86 万亿美元,距 6 万亿美元关口仅一步之遥…
  6. Oct 6, 2026法德推动欧盟完善碳排放规则 碳成本上升引发产业外迁担忧 法德正推动欧盟完善碳排放规则,保护欧洲企业出口竞争力,敦促欧盟委员会出台方案避免欧洲收紧气候规则后出现产业外迁,西班牙、意大…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →