MLX vs Ollama 实测:苹果官方方案三档全胜,最多快 31%(M5 Max 128G)

fubaba 未分类评论7阅读模式

苹果在 WWDC26 把 MLX 推上台:Mac 跑本地 AI 的官方答案。官方演示视频 48 万播放,评论区都在问同一个问题——比 Ollama 快多少?没人给数字。我用 M5 Max(128GB 统一内存),同一天、同三个模型、同三条问题,两边各跑三轮,把数字跑了出来。

▶ 视频直达:https://youtu.be/-JlhoMZNqs4

同机同日同题:三档全胜,但赢法完全不一样

模型 MLX(字/秒) Ollama(字/秒) MLX 领先
Qwen3-8B(稠密) 38.75 29.49 +31%
Qwen3-30B-A3B(MoE) 59.35 53.81 +10%
Llama3.3-70B(稠密) 3.97 3.49 +14%

规则很简单:同一台机器、同一天、同三条问题(短问答 / 中等推理 / 长文生成),每档取三轮平均。MLX 用 mlx-community 的 4bit 权重,Ollama 用默认量化,量化档位对齐。

为什么 MoE 上优势缩水了三分之二

8B 稠密快 31%,30B MoE 只快 10%。原因藏在架构里:MoE 每次只激活 30 亿参数,计算量一小,瓶颈就从算力挪到了内存带宽——而带宽这件事,两边用的是同一条统一内存,谁也快不了谁多少。换句话说,MLX 加速的是计算那一段,所以稠密模型受益最大。

真正拉开差距的是冷启动

70B 从点火到吐出第一个字:MLX 约 6 秒(加载 4.54s + 首 token 1.49s),Ollama 实测 16.4 秒——差了将近 3 倍。如果你的用法是偶尔问一句就走,体感差距全在这里。

意外发现:Ollama 两周慢了 4-11%

与 7 月 25 日同机数据比,Ollama 三个模型全线变慢:8B 33.26→29.49(-11%)、30B 59.38→53.81(-9%)、70B 3.64→3.49(-4%)。原因没有查清(可能是版本升级或后台负载),数字先放这里,欢迎评论区讨论。

结论:快,是有门槛的快

追速度、机器是 Apple Silicon,MLX 不是营销,是真快。但它要配 Python 环境,模型权重单独下载(三档 57GB 起步);Ollama 一行命令就能跑,生态依旧省心。另外,上期实测得出的「决定速度的是激活参数」规律,在 MLX 上原样成立(38.75×8÷70≈4.4,实测 3.97)。

更多真机实测视频,见 YouTube 频道「富爸爸AI实测」

文章末尾固定信息
weinxin
我的微信
微信扫一扫
fubaba
  • 本文由 发表于 2026年8月7日 19:36:20
  • 转载请务必保留本文链接:https://www.fubaba.org/81.html
评论  0  访客  0
匿名

发表评论

匿名网友

:?: :razz: :sad: :evil: :!: :smile: :oops: :grin: :eek: :shock: :???: :cool: :lol: :mad: :twisted: :roll: :wink: :idea: :arrow: :neutral: :cry: :mrgreen: