Soup 是一个把 LLM 微调压成「一个 YAML、一条命令」的开源工具,主打零 SSH、零配置地狱。核心卖点是 layer streaming 技术:把冻结的基座模型留在内存里,按层喂给 GPU,从而在 4GB 显存的笔记本显卡上微调 8B 模型。实测在 RTX 3050 Laptop 4GB 上跑 Llama-3.1-8B-Instruct + NF4,峰值显存 3.32 GB,速度 119.6 tok/s,且与常规驻留训练结果 bit-exact 一致。
最新 v0.73.2 主要修了发布门禁(soup ship)的误判问题。此前两套评测套件打分逻辑有误:mini_tool_call 在模型答对 40/40 时只给了 0.225 分,原因是解析器对少一个右花括号的 JSON 回退到了内部对象;mini_mmlu 因提取器不认识 \boxed{C} 且提示词未要求输出字母,把 Llama-3.1-8B 打到了 0.423 分(低于 0.5B 模型),现已修复至 0.731。
新增良性提示维度 mini_over_refusal,防止「拒绝一切请求」的模型被误判为安全提升;新增 --noise-floor 参数,通过多次重跑基座模型来排除 GPU 解码的随机波动,避免把噪声当改进。另有两项来自外部贡献者的更新:soup data split --stratify-semantic 和 soup mcp serve --allow-execute。
上一个版本 v0.72.4 已把 layer streaming 从 SFT 扩展到 DPO/ORPO/SimPO/KTO 等偏好对齐方法,内存占用仅为 SFT 峰值的 0.914 倍,且四种方法均与常规运行 bit-exact。注意:若用 v0.72.0 训练过 adapter,其权重键名含多余 .inner. 段导致加载失效,需重跑或重存。
项目采用 Apache-2.0 协议,支持 HuggingFace 上任意文本生成模型,提供 100+ 现成配方,并支持 Docker 部署。对算力有限、想在本地显卡上做微调或对齐实验的开发者来说,Soup 把基础设施成本降到了极低。
GitHub
#GitHub #开源 #Soup #LLM微调 #LayerStreaming #QLoRA #低显存训练 #开源工具
@GitHubTrendingHub