先给结论:让本地大模型「说人话」的不是换更大的模型,是给它接上你自己的知识库。
同一个问题问两遍。没接库时,模型发明了一个根本不存在的参数、虚构了一次「官方修复」,还自称「亲测有效」;接上我真实运行的 9688 篇笔记之后,同一个 30B 模型 0.5 秒翻出我半年前的实验记录,结论条条带出处。更意外的是:5GB 的 8B 小模型接了库,三道题拿满分,和 30B 打平——低配 Mac 也能有一个断网可用的第二大脑。
全程数据不出本机,成本 0 元。下面是完整实测数据和两次翻车实录。
▶ 视频直达:https://youtu.be/t3_gsggFEL0
一、索引:9688 篇笔记,28.6 万块,零失败
用 bge-m3 做嵌入,对我真实运行的知识库全量建索引(只读,零写入):
| 指标 | 实测值 |
|---|---|
| 篇数 | 9688 篇全量 |
| 切块 | 286,187 块 / 零失败 |
| 索引体积 | 1.5GB(sqlite 391MB + 向量 1.17GB) |
| 耗时 | 约 2.5 小时(bge-m3 满 GPU,约 1.1 篇/秒) |
| 检索延迟 | 0.5~1.2 秒(28.6 万块余弦全扫) |
耗时大头不是篇数,是那 22 个百万字级的资料库巨型文件。如果你的库以短笔记为主,同样的量级会快得多。
二、记分牌:5 道题 × 3 个通道
判分方式是硬标准,不是主观感受:每道题预设 4 个「只有我库里才有」的事实关键词,命中几个算几分。模型答得再漂亮,说不出库里那个数字就是 0 分。
| 题目 | 30B 裸问 | 30B + RAG | 8B + RAG |
|---|---|---|---|
| 音色漂移怎么修 | 1/4 | 4/4 | 4/4 |
| MLX vs Ollama 谁快 | 1/4 | 1/4 → 3/4(加权后) | 1/4 |
| B-roll 检查规则 | 0/4 | 3/4 | 4/4 |
| 封面双裁切标准 | 0/4 | 4/4 | 4/4 |
| 即梦档位怎么选 | 0/4 | 0/4 → 1/4(加权后) | 0/4 |
裸问一栏那几个 0 分很说明问题:模型对你的私有经验一无所知,但它不会承认,它会编。
三、8B 小模型逆袭:5GB 换一个第二大脑
最反直觉的一条:8B 模型接库后三题满分,和 30B 打平,个别题还更稳。
原因不难理解——RAG 场景里模型干的活主要是「读懂检索到的原文,然后复述并组织」,这是小模型也做得好的事。真正决定答案质量的是检索准不准,不是参数量。
反过来的证据也有:70B 接库跑同一道题只拿 2/4,抄答案都抄不全。这和上一集《本地模型能不能顶替订阅》的结论是一条线:大 ≠ 强。
四、两次翻车:一手实测被二手收藏淹没
q2 和 q5 两题接了库照样答错。查检索命中路径才发现病根:
我库里既有自己的实测记录,也有大量从外部收藏、采集回来的二手资料。同一个话题下,二手资料在数量上碾压,检索排序把它们全推到了前面,我自己跑出来的那份结论反而进不了上下文。
库越大,这个问题越严重。
修法是给元数据加权:自有结论优先,1.15 倍权重。改完之后,我自己的实测档案从榜外直接跳到 0.880 分榜首,q2 从 1/4 修到 3/4。
但要说清楚——q5 加权后只从 0/4 救回 1/4。加权是杠杆,不是银弹,检索层面的问题不会因为一个系数全部消失。
五、附带踩到的坑:ollama 默认 26 万上下文
跑 qwen3 时默认 num_ctx 会开到 26 万,KV 缓存直接吃掉 45GB 内存,换模型时卡死了 25 分钟。
钉到 16k 立刻痊愈。这个坑跟 RAG 本身无关,但只要你在本地跑长上下文模型就会撞上,值得单独记一笔。
六、你需要多少篇笔记才够用?
不用一万篇。
从实测结果反推:真正决定成败的是「这段内容是不是你自己写的、是不是记了具体数字」。一百篇你自己写的、带结论带数据的笔记,就足够让一个小模型开口说人话——而一万篇收藏来的二手资料,可能还不如那一百篇管用。
更多真机实测视频,见 YouTube 频道「富爸爸AI实测」。


评论