Mac 本地大模型速度实测:Ollama 跑 8B/30B/70B,30B 反而比 8B 快 79%

fubaba AI工具评论27阅读模式
摘要

M5 Max 128G Mac 用 Ollama 实测 8B/30B/70B 三档本地大模型:70B 只有 3.64 字/秒,30B MoE 却比 8B 快 79%。决定速度的不是总参数,是激活参数。附三笔隐藏成本。

先说结论:本地大模型的速度从来不由总参数决定,而由「每次激活多少参数」决定。128G 内存的 Mac(M5 Max)实测三档模型:70B 慢到每秒 3.64 个字,而参数大 4 倍的 30B MoE 反而比 8B 快 79%。

本文要点(30 秒版)

  • 实测数据:8B=33.26 字/秒;30B MoE=59.38 字/秒;70B=3.64 字/秒(M5 Max 128GB)
  • 反直觉点:30B 比 8B 参数大近 4 倍,速度反而快 79%——因为它是 MoE(a3b=每次只激活 30 亿参数)
  • 规律可验算:速度 ∝ 1/激活参数。用 8B 数据外推 70B 应为 3.80,实测 3.64,误差不到 5%
  • 本地部署三笔隐藏成本:内存(70B 跑起来吃 80G)、时间(三个模型下载 2 小时+)、电费
  • 建议:偶尔用选云端订阅;有隐私/批量需求再本地部署,选型认准激活参数

▶ 视频直达:https://youtu.be/81e2RQk6sGw

三档实测数据

模型 体积 速度(字/秒) 激活参数
qwen3 8B 约 5G 33.26 80 亿
qwen3 30B(MoE a3b) 约 18G 59.38 30 亿
llama3.3 70B 约 42G 3.64 700 亿

到 70B 为止都符合直觉:越大越慢。反常的是中间档——30B 比 8B 快了将近八成。

为什么参数大 4 倍反而更快

答案在模型名的小尾巴上:a3b。a 是 active(激活),3b 是 30 亿。它虽然揣着 300 亿参数,但每次干活只叫醒其中 30 亿——这叫混合专家(MoE)。可以理解成一个 300 人的顾问团,每次开会只请最对口的 3 个人,其余 297 人不占资源。

真正决定速度的,从来不是总共有多少参数,而是每次要动用多少。拿这条规律验算:8B 每秒 33 个字,那 70B 应该是 33×8÷70=3.8,实测 3.64,误差不到 5%。

本地部署省钱吗?三笔隐藏成本

  1. 内存:70B 跑起来吃掉 80G。128G 的机器能扛住,16G/32G 的门都进不去。
  2. 时间:三个模型下载花了两个多小时(挂代理、网速跑满的情况下;70B 单个就要 1 小时 45 分)。
  3. :满载推理风扇一直转,电费单会告诉你答案。

选型建议

偶尔问几句、写点东西:云端订阅是最便宜的选择,别折腾。有隐私要求或要批量跑:本地确实有意义,但记住那条规律——一个选对架构的 30B(MoE),能比选错的 8B 还快。

常见问题(FAQ)

Mac 能跑 70B 大模型吗?

128G 统一内存的 Mac(如 M5 Max)能跑:llama3.3 70B 运行时占约 80G 内存,速度每秒 3.64 个字——能跑但接近不可用,比正常语速还慢。

MoE 混合专家模型为什么快?

MoE 模型每次推理只激活一小部分参数(如 qwen3-30b-a3b 只激活 30 亿),速度由激活参数决定,所以 30B MoE 比 14B/8B 稠密模型更快。

本地部署大模型比 API 便宜吗?

低频使用不便宜:要付内存(硬件)、下载时间和电费三笔隐藏成本。只有隐私敏感或大批量场景,本地部署才划算。


相关文章

更多真机实测视频,见 YouTube 频道「富爸爸大妙招」

文章末尾固定信息
weinxin
我的微信
微信扫一扫
fubaba
  • 本文由 发表于 2026年7月29日 11:59:30
  • 转载请务必保留本文链接:https://www.fubaba.org/42.html
评论  0  访客  0
匿名

发表评论

匿名网友

:?: :razz: :sad: :evil: :!: :smile: :oops: :grin: :eek: :shock: :???: :cool: :lol: :mad: :twisted: :roll: :wink: :idea: :arrow: :neutral: :cry: :mrgreen: