TGViewer
Readhub Readhub @readhub_cn · 8.5K subscribers
Post #355965 21
研究发现大模型后训练极端稀疏监督可提升推理性能

针对大模型后训练普遍默认需要密集 token 级监督的假设,研究团队以 OPD 在线策略蒸馏为初始场景开展实验,发现仅保留单条推理轨迹中 1 个 token 的极端稀疏梯度信号,不仅不会导致训练崩溃,还能显著提升大模型的推理能力。团队基于 9 组不同师生模型配置开展测试,进一步发现选取轨迹中师生模型输出分歧最大的 1 到 2 个 token 作为监督信号,效果甚至能超过全信号训练,所得学生模型性能可超越教师模型,且该场景下学生并非单纯模仿教师获得性能提升。该现象在代码推理任务、Llama 系列模型以及 RLVR 后训练范式中均得到验证。相关机制研究显示,推理性能提升和监督信号稠密程度并非单调关系,万分之一的监督信号仅需更新 10% 的网络参数即可大幅提升推理能力,效果差异还和师生模型的表征能力相对强弱有关。研究团队类比人类学习过程,认为经过预训练等阶段的大模型本身已具备基础推理能力,少量关键的监督信号就足以引导模型调整,获得显著的推理性能提升。

媒体报道
万分之一 —— 大模型后训练中的极端稀疏监督 机器之心/腾讯网

#热门话题
More from @readhub_cn
  1. Oct 3, 2026AI 灌水稿激增:预印本平台 arXiv 出台新规 每人每月限投 2 篇 预印本开放获取平台 arXiv 开始实施全新速率限制政策,将所有投稿者每月提交上限设为 2 篇、同时在审活…
  2. Oct 3, 2026截至 8 月末我国 5G 基站总数超 519 万个 工业和信息化部发布数据显示今年前 8 个月我国电信业务总量稳步增长,5G 等网络建设和应用不断推进,截至 8 月末 5G 基站总…
  3. Oct 3, 2026华为李小龙回应睿影 Z10 不支持 62mm 滤镜:为避免遮挡红枫摄像头偏色 华为在 Mate 90 系列及全场景新品发布会上发布全栈自研的睿影 Z10 模块相机,采用 Hyper…
  4. Oct 3, 2026消息称亚马逊考虑剥离并回租 80 亿美元英伟达 Grace Blackwell AI 芯片 亚马逊拟将价值约 80 亿美元的英伟达 Grace Blackwell AI 芯片剥离至…
  5. Oct 3, 2026韩国五大商业银行遭黑客攻击 三家出现客户信息泄露 10 月 3 日,韩国五大商业银行均遭遇黑客攻击或入侵尝试,其中新韩银行约 2.5 万名客户、KB 国民银行逾 100 名客户及韩…
  6. Oct 3, 20266M 参数 DepthART 轻量深度估计模型可部署至 Jetson 等端侧设备 DepthART 针对单目深度估计领域大模型泛化性强但部署难、传统轻量模型泛化性不足的断层问题,探…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →