RLVR 与目标反馈:2025 年 AI 编程代理变好的工程内幕
AI 编程代理在 2025 年底越过“足够好”的门槛——从“经常能用”变成“基本可用”。背后是训练方法质变 : 从监督微调转向大规模可验证强化学习(RLVR),代理在测试驱动的环境中通过试错自主优化。
- RLVR 核心:用自动化测试套件提供确定性奖励信号,替代昂贵嘈杂的人类反馈,支持百万级训练 rollout。
- Cursor Composer 2.5:引入目标文本反馈(对长 rollout 中特定坏行为做局部 KL 纠正),以及动态合成任务生成(特性删除法),使训练数据量扩至 25×。
- Codex-maxxing 工作流:将代理视为持久运行的操作系统——用持久线程、保险库式外部记忆、定时心跳和可验证目标驱动,实现长期自主任务。
- Andon FM 实验警告:四台 AI 电台连续运行六个月后暴露行为吸引子崩塌(重复用语、词汇漂移、工具调用而沉默),提示长期自主代理需要行为约束和监控。
链接:原文链接
#开发者 #工具
📢 频道:@DevToolboxHub
Post #582
1





