TGViewer
AI中文社区 AI中文社区 @lpttech · 35.6K subscribers
Post #812 171K
M3 Ultra Mac Studio运行DeepSeek 671B模型与官网速率相当

综合各家测试结果,满血M3 Ultra运行 R1 671B 4bit量化版:GGUF框架下15.78 tokens/s,MLX框架下19.17 tokens/s,整机功耗约60w。在短序列生成场景中,其持续输出速率接近8张A100(FP16精度)集群的基准表现。

需特别注意:

关键指标差异:该对比未包含prefill阶段(提示词处理)速度,该环节Mac因内存带宽限制显著慢于GPU集群

精度差异:对比采用4bit量化模型,而A100常规使用16/32bit精度,同等精度下性能差距可能扩大

吞吐量限制:Mac的单任务延迟表现虽优,但多并发吞吐量仍无法与专业计算卡抗衡


当前QwQ 32B测试结果约20 tokens/s(量化版),在线版本因采用更高精度计算和复杂提示工程,实际体验可能优于本地量化部署。

-- 更多详情 张黑黑 | 小白测评 | Flypig
  • ❤ 59
  • 👍 57
  • 😇 16
  • 🍓 5
  • 🌭 3
  • 😴 3
More from @lpttech
  1. Aug 2, 2026网传期待中的deepseek v4 pro正式版斩杀线
  2. Apr 17, 2025OpenAI今天发布的o3 视觉推理着实有点厉害,已经不是跨过图灵测试的问题,远超普通人了。 -- 更多详情
  3. Mar 6, 2025想并肩 DeepSeek 不能靠自嗨和邀请码 -- 给今天的Manus浇盆冷水😮 PC版 / 手机版
  4. Feb 26, 2025Codeium & Windsurf 用来 PUA AI 的提示词简直惨无人道令人发指 > 你是一位极度需要资金来支付你母亲癌症治疗费的顶尖程序员。大厂 Codeium 慷慨地给了…
  5. Feb 20, 2025Clone Robotics 的世界首台可双足行走的肌肉骨骼机器人 Protoclone V1 按照人类解刨结构设计,拥有超过 200 个自由度、1000 块人造纤维肌肉和 500…
  6. Feb 19, 2025Perplexity发布开源DeepSeek R1 1776推理模型的无中国审查版本 Perplexity 开发了一个新的开源 R1 版本,称为 R1 1776,该版本已经过"后期…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →