用对比学习把当前状态和候选动作映射到同一空间,让 Agent 不必为每个任务单独微调,也能快速判断、排序和路由动作。
https://github.com/Contrastive-LM/CLM
CLM 是一种专门做快速决策的 System One 模型,用双向 InfoNCE 损失学习状态和正确动作的对应关系。CLM-8B 依次使用 6000 万组问答、3000 万组合成难负样本和 100 万条 Agent 轨迹训练。
Hermes/OpenClaw | AI探索
Post #1365
473

- 👍 1