KTransformers 是一个通过 CPU-GPU 异构计算高效推理和微调大语言模型的开源研究项目。基于 kt-kernel 提供两个用户能力:Inference 和 SFT。
推理方面,KTransformers 提供 CPU 优化内核,支持 AMX/AVX 加速、MoE 优化和量化推理。在 8×L20 GPU + Xeon Gold 6454S 配置下,DeepSeek-R1-0528(FP8)总吞吐达 227.85 tokens/s,输出吞吐 87.58 tokens/s。已支持 MiniMax-M3、GLM-5.2、DeepSeek-V4-Flash、Kimi-K2.5 等最新模型,并集成 SGLang。
微调方面,KTransformers 与 LLaMA-Factory 集成,支持在有限 GPU 内存上微调超大规模 MoE 模型,如 DeepSeek-V3/R1 可在 4×RTX 4090 上训练(约 80GB 内存,3.7 it/s)。支持 RL-DPO 微调、多种量化精度和 CPU-GPU 专家调度。
GitHub
#GitHub #开源 #KTransformers #LLM #CPU #GPU #异构计算 #推理 #微调 #MoE #DeepSeek #SFT
@GitHubTrendingHub


