先说结论:本地大模型是真能干活的,但它的价格标签从来不是电费,是你的等待时间。订阅费买的也不是一个更聪明的 AI,是一个不用等的 AI。
我把本机的两个本地模型(Llama3.3 70B,42GB;千问3 30B-A3B,18GB)和我付费订阅的云端 AI 拉到一起,打了四场真实工作的比赛:写小红书文案、修一段带 3 个 bug 的代码、读 3000 字长文压要点、英译中。判分尽量客观:代码题配了 5 项单元测试,谁跑过算谁的;总结题逐条对照原文核对数字。
第一个意外:修代码,三家全对
三个 bug 不算好抓:相邻日期区间漏合并、区间最后一天没计入、月份格式没补零。结果云端、30B、70B 三家提交的修复版全部通过 5/5 项测试。本地模型写代码的能力,已经过了"能不能用"这条线。
区别在耗时:云端 15 秒,30B 用了 106.6 秒,70B 要 148.7 秒。
第二个意外:中杯比大杯能打
写文案这场,30B 的小红书笔记语气地道、会加表情符号、字数达标;70B 慢慢悠悠写了 224.8 秒,交上来一篇产品说明书腔的稿子,要求 400 字以内,它连标题带标签写了 587 个字。
翻译这场 70B 直接翻车:原文的 "70B model"(七百亿参数),它翻成了「70 亿参数」——数量级没了,而且翻错的恰好是它自己的参数量。速度上 30B 实测 42.3 词/秒,70B 只有 2.4 词/秒:参数是 2.3 倍,速度是 1/17。在统一内存的 Mac 上,大不等于强。
电费这本账,根本不存在
很多人算"本地跑模型电费贵不贵"。我用 powermetrics 守着实测:这台 M5 Max 待机整机约 3 瓦,推理时约 7 瓦——增量只有 4 瓦。70B 打满四场比赛总耗电约 0.001 度,按居民电价不到一厘钱。
真正的成本是时间:四场比赛云端总共 1 分 56 秒,30B 用了 4 分 37 秒,70B 用了 9 分 36 秒——整整 5 倍。
怎么选:三种人对号入座
1. 机器内存够大、活不赶时间、数据敏感不想上云——本地 30B 这一档真能顶班,写代码和写文案都拿得出手。
2. 大部分人——老老实实留着订阅。你付的每一分钱,买的都是那一声秒回。
3. 迷信"参数越大越强"的——70B 四场一场没赢。至少在消费级机器上,先看激活参数和内存带宽,再看参数总量。
测试环境:M5 Max 128GB 统一内存,Ollama 默认量化;云端为付费订阅档。所有数字来自同一天同一台机器的实测,判分脚本和原始输出都留了档。
上一篇实测:MLX vs Ollama 实测:苹果官方方案三档全胜,最多快 31%(M5 Max 128G)。视频版见文首,频道主页:富爸爸AI实测。


评论