先说结论:本地大模型的速度从来不由总参数决定,而由「每次激活多少参数」决定。128G 内存的 Mac(M5 Max)实测三档模型:70B 慢到每秒 3.64 个字,而参数大 4 倍的 30B MoE 反而比 8B 快 79%。
本文要点(30 秒版)
- 实测数据:8B=33.26 字/秒;30B MoE=59.38 字/秒;70B=3.64 字/秒(M5 Max 128GB)
- 反直觉点:30B 比 8B 参数大近 4 倍,速度反而快 79%——因为它是 MoE(a3b=每次只激活 30 亿参数)
- 规律可验算:速度 ∝ 1/激活参数。用 8B 数据外推 70B 应为 3.80,实测 3.64,误差不到 5%
- 本地部署三笔隐藏成本:内存(70B 跑起来吃 80G)、时间(三个模型下载 2 小时+)、电费
- 建议:偶尔用选云端订阅;有隐私/批量需求再本地部署,选型认准激活参数
▶ 视频直达:https://youtu.be/81e2RQk6sGw
三档实测数据
| 模型 | 体积 | 速度(字/秒) | 激活参数 |
|---|---|---|---|
| qwen3 8B | 约 5G | 33.26 | 80 亿 |
| qwen3 30B(MoE a3b) | 约 18G | 59.38 | 30 亿 |
| llama3.3 70B | 约 42G | 3.64 | 700 亿 |
到 70B 为止都符合直觉:越大越慢。反常的是中间档——30B 比 8B 快了将近八成。
为什么参数大 4 倍反而更快
答案在模型名的小尾巴上:a3b。a 是 active(激活),3b 是 30 亿。它虽然揣着 300 亿参数,但每次干活只叫醒其中 30 亿——这叫混合专家(MoE)。可以理解成一个 300 人的顾问团,每次开会只请最对口的 3 个人,其余 297 人不占资源。
真正决定速度的,从来不是总共有多少参数,而是每次要动用多少。拿这条规律验算:8B 每秒 33 个字,那 70B 应该是 33×8÷70=3.8,实测 3.64,误差不到 5%。
本地部署省钱吗?三笔隐藏成本
- 内存:70B 跑起来吃掉 80G。128G 的机器能扛住,16G/32G 的门都进不去。
- 时间:三个模型下载花了两个多小时(挂代理、网速跑满的情况下;70B 单个就要 1 小时 45 分)。
- 电:满载推理风扇一直转,电费单会告诉你答案。
选型建议
偶尔问几句、写点东西:云端订阅是最便宜的选择,别折腾。有隐私要求或要批量跑:本地确实有意义,但记住那条规律——一个选对架构的 30B(MoE),能比选错的 8B 还快。
常见问题(FAQ)
Mac 能跑 70B 大模型吗?
128G 统一内存的 Mac(如 M5 Max)能跑:llama3.3 70B 运行时占约 80G 内存,速度每秒 3.64 个字——能跑但接近不可用,比正常语速还慢。
MoE 混合专家模型为什么快?
MoE 模型每次推理只激活一小部分参数(如 qwen3-30b-a3b 只激活 30 亿),速度由激活参数决定,所以 30B MoE 比 14B/8B 稠密模型更快。
本地部署大模型比 API 便宜吗?
低频使用不便宜:要付内存(硬件)、下载时间和电费三笔隐藏成本。只有隐私敏感或大批量场景,本地部署才划算。
相关文章
更多真机实测视频,见 YouTube 频道「富爸爸大妙招」。


评论