Mac 内存加一倍 AI 一秒没快?本地大模型四档实测判决表

fubaba AI工具评论59阅读模式

一台内存加到顶的 128G Mac,我用系统显存上限把它真实卡成 16G / 32G / 64G / 128G 四档,同一批开源大模型(通义千问 Qwen3 4B/8B/14B/27B、混合专家版 30B,Meta 的 Llama 3.3 70B)全部各跑一遍。结论先说:内存不买速度,买的是「装不装得下」和「能记多长」。同一个 30B 混合专家模型,在 32G/64G/128G 上都是每秒 87 到 97 个字,速度几乎不变;但同一个 27B,32G 只准它记 4,096 字,64G 记 32,768 字,128G 能记 262,144 字。下面是四档全部数字,以及一张判决表。

▶ 视频直达:https://youtu.be/bnbGpHlalbU

实测方法:一台机器,卡成四台

我没有四台不同配置的机器,用的是同一台 128G 统一内存的 Mac,靠 sysctl iogpu.wired_limit_mb 把系统显存上限分别锁到 16G(10922MB)、32G(21845MB)、64G(43690MB),128G 档不设限。先说清一件事:Mac 的内存和显存是同一块,叫统一内存,系统只肯拿大约三分之二给模型用——16G 的机器,模型真能用的显存只有 10.9G。四档 × 本机现有模型(Ollama 本地通道)全部真跑,数字来自 bench/tier_*.json。

16G 档:反常识的开局——塞一半反而更快

通义千问 4B/8B/14B 都能整个塞进 10.9G 显存,速度分别是 134、81、45 字/秒。真正反常识的是 30B 混合专家版:显存不够,只塞进去 54%,剩下的甩给 CPU,按理该更慢——结果它跑出每秒 61 个字,比整个塞进显存的 14B(45 字/秒)还快三成。代价是:它只被允许记 4,096 字,显存不够,上下文被悄悄砍掉。

32G 档:看起来很美,一开长上下文就露馅

32G 上,30B 混合专家整个进了显存,速度直接拉到每秒 87 字;27B 稠密模型也完整装下,21 字/秒。看起来很美——直到我让 27B 记 32,768 字(三万两千字):显存立刻不够,一成模型被挤到 CPU,速度从 21 掉到 17,掉了近两成。结论:32G 能跑,但一干长活就得将就。

64G 档:终于能真正干活

64G 上,27B 和 30B 都能带着 32,768 字的上下文整个待在显卡里,速度一点没掉(27B 仍 20.7 字/秒,30B 仍 88.5 字/秒)。那 70B 呢?Meta 的开源大模型 Llama 3.3 70B,在 64G 上只能塞进去八成(82% 进显存),首字要等 12 秒,跑起来每秒 6.2 个字。

128G 档:装得下,也跑不动

上了 128G,70B 终于整个塞进显存,可速度只有每秒 6.6 个字——比 64G 的 6.2 快不了多少。70B 不是内存问题,是芯片带宽问题:装得下也跑不动,别为了它花钱买 128G。128G 真正买到的,是同一个 27B 能记的字从 4,096 变成 262,144,外加跑 70B 的入场门票——一张进去也没多大用的门票。

一条规律

内存决定装不装得下、能记多长;速度由芯片带宽决定,跟内存大小基本没关系。多花的每一档钱,买的不是更快的 AI,是更大的记性。

四档判决表

  1. 16G:4B/8B/14B 能整个塞进显存,只够入门玩玩,30B 只能记 4,096 字
  2. 32G:27B / 30B 都装得下,30B 每秒 87 字;一开长上下文就溢出、速度掉近两成——能跑,干长活将就
  3. 64G:27B / 30B 带着 3 万 2 千字上下文整个待在显卡里,速度一点不掉——想真拿本地干活,就是这档
  4. 128G:同一个 27B 能记 262,144 字;70B 全塞进去也只有 6.6 字/秒——只有数据死活不能出门、还要喂超长文档的人才值,别为了 70B 买它

实测环境与数字汇总

  • 机器:Mac 顶配款(M5 Max,128G 统一内存);本地推理框架:Ollama
  • 限显存:sysctl iogpu.wired_limit_mb,16G=10922MB / 32G=21845MB / 64G=43690MB / 128G=不限
  • 30B 混合专家速度:16G 61 字/秒(54% 进显存)→ 32G 87 字/秒 → 64G 88.5 字/秒 → 128G 96.8 字/秒
  • 27B 稠密模型上下文(Ollama 自动分配):32G 4,096 字 → 64G 32,768 字 → 128G 262,144 字
  • 70B 速度:64G 6.2 字/秒(82% 进显存)→ 128G 6.6 字/秒(100% 进显存)

本文数据均为 2026-09-01 本人真机记录,不同机型、模型、量化档结果会不同,请以自己的实测为准。

上一篇:顶配 Mac 跑本地大模型,我死心了:128G 机器满载降频、缓存一断读 11 万字 166 秒,订阅版 15 秒

更多真机实测视频,见 YouTube 频道「富爸爸AI实测」。

下一篇:普通人用 AI 接单赚了 9000 元,我扒开看了他到底做对了什么

文章末尾固定信息
weinxin
我的微信
微信扫一扫
fubaba
  • 本文由 发表于 2026年9月15日 08:31:41
  • 转载请务必保留本文链接:https://www.fubaba.org/147.html
评论  0  访客  0
匿名

发表评论

匿名网友

:?: :razz: :sad: :evil: :!: :smile: :oops: :grin: :eek: :shock: :???: :cool: :lol: :mad: :twisted: :roll: :wink: :idea: :arrow: :neutral: :cry: :mrgreen: