oMLX 是一个面向 Apple Silicon 的 LLM 推理服务器,核心卖点是连续批处理与分层 KV 缓存,并可直接从 macOS 菜单栏管理。项目源自 vllm-mlx,现已独立演进,支持文本 LLM、视觉模型、OCR、嵌入与重排序模型。
它解决了本地 LLM 服务「便利与可控不可兼得」的痛点:你可以把常用模型常驻内存、按需自动换入大模型、设置上下文长度,全程在菜单栏完成。KV 缓存分热(内存)冷(SSD)两层,即使对话中途切换上下文,历史缓存仍可复用,这让 Claude Code 等工具在本地跑真实编码任务变得实用。
本次更新重点:
• 支持 GLM-5.2
• MiniMax M3
• Qwen3.5 系列的原生自定义内核(对 GLM-5.2 预填充速度提升约 30 倍,实测 M3 Ultra 上 845 vs 约 29 tok/s),但需完整 Xcode 或官方 DMG 预编译版本;新增实验性多 Mac 分布式推理,可将单个模型拆分到不同内存容量的 Mac 上运行;管理面板支持一键接入 OpenClaw
• OpenCode
• Codex 等工具,并内置模型下载器与性能基准测试
安装方式灵活:可直接下载 DMG,或通过 Homebrew(brew install jundot/omlx/omlx)安装,也支持从源码构建。要求 macOS 15.0+、Python 3.11–3.13 与 Apple Silicon。API 兼容 OpenAI 与 Anthropic 接口,任何兼容客户端均可连接本地 8000 端口。
GitHub
#GitHub #开源 #oMLX #AppleSilicon #LLM #macOS #MLX #本地推理 #KV缓存
@GitHubTrendingHub



