我把一台内存加到顶、官网卖好几万的 128G 顶配 Mac,装上阿里最新的开源大模型通义千问 Qwen3.8,替你把「买台高配电脑跑本地模型、从此不交 AI 订阅费」这笔账全程跑了一遍。结论先说:装得下,跑不动。它是个便宜的批处理工人,当不了干活主力。下面是四场实验的全部数字,以及什么人该买机器、什么人该买订阅的三档判决表。
▶ 视频直达:https://youtu.be/4E1_SOOC1mo
开头那一幕:读一份资料,两分四十六秒一个字没吐
先说最刺眼的一组数。我让这台机器读一份 11 万字的资料再回答问题。从按下回车到它吐出第一个字,166 秒。同样的资料、同样的要求,丢给每月 20 美元(约 140 元)的订阅版 AI,15 秒。差了 11 倍。这不是偶发,是本地跑模型的日常,后面会讲为什么。
实验一:连续满载 30 分钟,芯片频率腰斩
刚开机确实像样:提个问题,一秒多就开口,写东西也不算慢。问题出在连续干活。我让它不停跑了 30 分钟,全程记录芯片频率和生成速度:
- 前 5 分钟机器就烫了,芯片频率从 1456 MHz 掉到 615 MHz,直接腰斩
- 生成速度掉了 31%,之后一直趴在低位,再也没起来
这不是手感,是 powermetrics 全程记录的数据。云端机房替你扛的散热,在自己桌上就是实打实的降频。
实验二:聊天记录养到 8 万 token,比我想的扛造
「越聊越慢」这件事我也测了。把一个对话一路养到 8 万 token(约 11 万汉字),顺着聊下去,开口等待从 1.4 秒爬到 28 秒。难受,但能忍——因为本地推理框架有前缀缓存,顺聊只重算新增部分。这一项我原本以为会是最惨的,结果它不是元凶。
实验三:真正要命的是「缓存一断」
元凶在这里。你重启一次电脑、或者换个对话接着干活,缓存就没了,它得把资料从头再读一遍。11 万字,166 秒才开口,就是开头那一幕。而干正经活的时候,换对话、重开这种事一天要来无数次。
原理一句话:AI 每次回答,都要把前面的内容全部重读一遍。在云端你感觉不到,那笔算力账平台替你付了。在自己电脑上,每一秒等待都记在你自己头上。
实验四:本地省的真是电费吗
很多人以为本地模型省的是电费。我实测跑满四场大任务,电费不到一厘钱。电从来不是本地的价格——你的等待,和压在桌上的几万块,才是。我之前还测过,聊天记录再厚,云端也不会变慢(见上一篇)。
三档判决表:什么人该买机器、什么人该买订阅
- 该买高配机跑本地的:数据死活不能出门(合规/保密要求),加上有大量不赶时间的夜间批量粗活。它是个便宜的批处理工人,断网也能干。
- 该老实买订阅的:想让 AI 当干活主力的所有人。你付的钱买的是别人机房替你扛的算力、散热和等待。
- 俩都不用买的:偶尔问问题、写个邮件,各家免费档就够了,先用到不够再说。
实测环境与数字汇总
- 机器:Mac 顶配款,128G 统一内存;模型:通义千问 Qwen3.8(开源),本地推理框架 oMLX
- 满载 30 分钟:频率 1456→615 MHz,速度 −31%
- 对话养到 8 万 token:顺聊开口 1.4 秒→28 秒
- 缓存失效冷读 11 万字:166 秒才出第一个字
- 同任务订阅版:15 秒
- 四场大任务电费:不到一厘钱
本文数据均为 2026-08-31 本人真机记录,不同机型、模型、量化档结果会不同,请以自己的实测为准。
上一篇:AI 生成内容 9 月起必须打标:四个平台在哪勾、哪些算、不标会怎样
相关:ChatGPT、Claude 越聊越慢越笨?我猜错了——什么时候该开新对话
下一篇:Mac 内存加一倍 AI 一秒没快?本地大模型四档实测判决表
更多真机实测视频,见 YouTube 频道「富爸爸AI实测」。


评论