MiniMind:2 小时训练出 64M 超小语言模型
MiniMind 是一个极轻量的开源 LLM 项目,使用纯 PyTorch 从零实现,参数仅约 64 M(约为 GPT‑3 的 1/2700),可在单张 NVIDIA 3090 上以约 2 小时、3 元人民币的成本完成完整的预训练 + SFT。项目提供完整的模型结构、Tokenizer、数据清洗、预训练、监督微调、LoRA、RLHF(DPO)以及 RLAIF(PPO/GRPO/CISPO)等全链路代码,还支持 MoE、视觉 MiniMind‑V、多模态 MiniMind‑O、扩散 MiniMind‑dLM 与线性 MiniMind‑Linear。
对开发者而言,MiniMind 让个人 GPU 能快速复现、调研大模型全流程,适合想深入 LLM 结构、实验新训练算法或在低算力环境下部署对话模型的用户。
GitHub
#GitHub #开源 #MiniMind #LLM #PyTorch #模型训练 @GitHubOpenSource
@GitHubTrendingHub
Post #982
10
