本地部署大模型时,Ollama 下载页那排 Q4_K_M / Q8_0 / FP16 后缀到底选哪个?多数人闭眼选了最小的,心里一直犯嘀咕:体积小了 3 倍,是不是也笨了 3 倍?这一期用一场"开考前上锁"的考试,把这件事测清楚。全程在同一台 M5 Max(128G)上完成,temperature=0、seed 固定,任何人可复现。
▶ 视频直达:https://youtu.be/8ko6pdmvPKk
量化是什么
模型里的每个参数本来用 16 位存储(FP16,满血版);砍到 8 位(Q8)体积少一半,砍到 4 位(Q4)只剩三分之一。就像电话本把每个号码从十六位删到四位——省地方,但你会担心:还打得通吗?
实测设计:开考前上锁
七道题:三道算术、一道修代码、一道长文找数字、一道翻译、一道结构化输出。题目和判分脚本开考前先算 sha256 指纹存档,考完不许改;temperature=0,谁来跑结果都一样。被测对象是同一个 qwen3:8b 的三个量化档,外加一个彩蛋选手 30B-A3B 的 Q4 版。
第一轮记分牌:三档全满分
| 档位 | 体积 | 实测显存 | 速度 (tok/s) | 得分 |
|---|---|---|---|---|
| 8B-Q4_K_M | 5.2GB | 6.2GB | 27.4 | 7/7 |
| 8B-Q8_0 | 8.9GB | 9.6GB | 17.3 | 7/7 |
| 8B-FP16 | 16GB | 15.4GB | 12.1 | 7/7 |
| 30B-A3B-Q4(彩蛋) | 18GB | 18.0GB | 57.7 | 6/7* |
结论很直白:这套覆盖数学/代码/召回/翻译/JSON 的题组上,从 Q4 升到 FP16,多花 2.5 倍显存、慢 2.3 倍,分数一分没多。
加难:Q4 把正确答案写在草稿纸上,然后开始怀疑人生
我不服,是不是题太简单?乘法从 5 位数往上爬坡:
- 5位×5位:三档全对
- 6位×6位:Q8 用 201 秒算对,FP16 用 273 秒算对——Q4 十五分钟没出来
- 7位×7位:Q4 又算对了(125 秒)
打开 Q4 的"草稿纸"(思考流),那个 12 位的正确答案 479,069,562,063 明明白白写在那里。它在干嘛?在一遍一遍问自己"是不是哪一步错了"——同一句怀疑无限循环。换 3 个随机种子全部复现。同一道题,Q8 的草稿纸 4,897 字收工;Q4 写了 20,000+ 字还在写。
病不在能力(7 位题它照样对),病在停不下来。量化在这台机器上砍掉的不是"算对的能力",是推理链的停机稳定性。
同一笔内存的正确花法
16GB 内存,可以装 8B 的满血版(12.1 tok/s),也可以装参数量近 4 倍的 30B-A3B 的 Q4 版(57.7 tok/s)——快 4.8 倍,还只错了一道题。同内存预算下,"大模型的 Q4"完胜"小模型的 FP16"。
判分器冤案第二集
30B 唯一的 ❌ 是长文数字召回:它把 10 个数字全部记住了,只是抄下来的时候丢了"TB"单位,被上锁的正则判死。上一次判分器闹冤案是把 34 厘米看成 2 厘米(见 E25:给 AI 装 68 个技能包那期的前情),这一次轮到单位失踪——规矩上锁的代价,就是它不讲人情。
三档怎么选(对号入座)
- 日常问答、写作、翻译:Q4 闭眼用,省下的内存是白赚的;
- 长推理、长计算:Q8,多花 4 个 G 买的不是分数,是它能停下来;
- FP16:在这台机器上没有你的位置——同一笔内存不如换成更大模型的 Q4。
一句话总结:量化砍掉的不是智商,是它对自己答案的信心。
相关阅读:E24:AI Agent 到底是什么?200 个乱文件实测 | E25:给 AI 装 68 个技能包
实验原始数据(results.jsonl,temperature=0/seed=42)可复现,视频置顶评论提供获取方式。
更多真机实测视频,见 YouTube 频道「富爸爸AI实测」。


评论