苹果在 WWDC26 把 MLX 推上台:Mac 跑本地 AI 的官方答案。官方演示视频 48 万播放,评论区都在问同一个问题——比 Ollama 快多少?没人给数字。我用 M5 Max(128GB 统一内存),同一天、同三个模型、同三条问题,两边各跑三轮,把数字跑了出来。
▶ 视频直达:https://youtu.be/-JlhoMZNqs4
同机同日同题:三档全胜,但赢法完全不一样
| 模型 | MLX(字/秒) | Ollama(字/秒) | MLX 领先 |
|---|---|---|---|
| Qwen3-8B(稠密) | 38.75 | 29.49 | +31% |
| Qwen3-30B-A3B(MoE) | 59.35 | 53.81 | +10% |
| Llama3.3-70B(稠密) | 3.97 | 3.49 | +14% |
规则很简单:同一台机器、同一天、同三条问题(短问答 / 中等推理 / 长文生成),每档取三轮平均。MLX 用 mlx-community 的 4bit 权重,Ollama 用默认量化,量化档位对齐。
为什么 MoE 上优势缩水了三分之二
8B 稠密快 31%,30B MoE 只快 10%。原因藏在架构里:MoE 每次只激活 30 亿参数,计算量一小,瓶颈就从算力挪到了内存带宽——而带宽这件事,两边用的是同一条统一内存,谁也快不了谁多少。换句话说,MLX 加速的是计算那一段,所以稠密模型受益最大。
真正拉开差距的是冷启动
70B 从点火到吐出第一个字:MLX 约 6 秒(加载 4.54s + 首 token 1.49s),Ollama 实测 16.4 秒——差了将近 3 倍。如果你的用法是偶尔问一句就走,体感差距全在这里。
意外发现:Ollama 两周慢了 4-11%
与 7 月 25 日同机数据比,Ollama 三个模型全线变慢:8B 33.26→29.49(-11%)、30B 59.38→53.81(-9%)、70B 3.64→3.49(-4%)。原因没有查清(可能是版本升级或后台负载),数字先放这里,欢迎评论区讨论。
结论:快,是有门槛的快
追速度、机器是 Apple Silicon,MLX 不是营销,是真快。但它要配 Python 环境,模型权重单独下载(三档 57GB 起步);Ollama 一行命令就能跑,生态依旧省心。另外,上期实测得出的「决定速度的是激活参数」规律,在 MLX 上原样成立(38.75×8÷70≈4.4,实测 3.97)。
更多真机实测视频,见 YouTube 频道「富爸爸AI实测」。


评论