本地 RAG 实测:把 9688 篇笔记喂给 Ollama,AI 从张口就编到条条带出处

fubaba AI工具评论89阅读模式

先给结论:让本地大模型「说人话」的不是换更大的模型,是给它接上你自己的知识库。

同一个问题问两遍。没接库时,模型发明了一个根本不存在的参数、虚构了一次「官方修复」,还自称「亲测有效」;接上我真实运行的 9688 篇笔记之后,同一个 30B 模型 0.5 秒翻出我半年前的实验记录,结论条条带出处。更意外的是:5GB 的 8B 小模型接了库,三道题拿满分,和 30B 打平——低配 Mac 也能有一个断网可用的第二大脑。

全程数据不出本机,成本 0 元。下面是完整实测数据和两次翻车实录。

▶ 视频直达:https://youtu.be/t3_gsggFEL0

一、索引:9688 篇笔记,28.6 万块,零失败

用 bge-m3 做嵌入,对我真实运行的知识库全量建索引(只读,零写入):

指标 实测值
篇数 9688 篇全量
切块 286,187 块 / 零失败
索引体积 1.5GB(sqlite 391MB + 向量 1.17GB)
耗时 约 2.5 小时(bge-m3 满 GPU,约 1.1 篇/秒)
检索延迟 0.5~1.2 秒(28.6 万块余弦全扫)

耗时大头不是篇数,是那 22 个百万字级的资料库巨型文件。如果你的库以短笔记为主,同样的量级会快得多。

二、记分牌:5 道题 × 3 个通道

判分方式是硬标准,不是主观感受:每道题预设 4 个「只有我库里才有」的事实关键词,命中几个算几分。模型答得再漂亮,说不出库里那个数字就是 0 分。

题目 30B 裸问 30B + RAG 8B + RAG
音色漂移怎么修 1/4 4/4 4/4
MLX vs Ollama 谁快 1/4 1/4 → 3/4(加权后) 1/4
B-roll 检查规则 0/4 3/4 4/4
封面双裁切标准 0/4 4/4 4/4
即梦档位怎么选 0/4 0/4 → 1/4(加权后) 0/4

裸问一栏那几个 0 分很说明问题:模型对你的私有经验一无所知,但它不会承认,它会编。

三、8B 小模型逆袭:5GB 换一个第二大脑

最反直觉的一条:8B 模型接库后三题满分,和 30B 打平,个别题还更稳。

原因不难理解——RAG 场景里模型干的活主要是「读懂检索到的原文,然后复述并组织」,这是小模型也做得好的事。真正决定答案质量的是检索准不准,不是参数量。

反过来的证据也有:70B 接库跑同一道题只拿 2/4,抄答案都抄不全。这和上一集《本地模型能不能顶替订阅》的结论是一条线:大 ≠ 强。

四、两次翻车:一手实测被二手收藏淹没

q2 和 q5 两题接了库照样答错。查检索命中路径才发现病根:

我库里既有自己的实测记录,也有大量从外部收藏、采集回来的二手资料。同一个话题下,二手资料在数量上碾压,检索排序把它们全推到了前面,我自己跑出来的那份结论反而进不了上下文。

库越大,这个问题越严重。

修法是给元数据加权:自有结论优先,1.15 倍权重。改完之后,我自己的实测档案从榜外直接跳到 0.880 分榜首,q2 从 1/4 修到 3/4。

但要说清楚——q5 加权后只从 0/4 救回 1/4。加权是杠杆,不是银弹,检索层面的问题不会因为一个系数全部消失。

五、附带踩到的坑:ollama 默认 26 万上下文

跑 qwen3 时默认 num_ctx 会开到 26 万,KV 缓存直接吃掉 45GB 内存,换模型时卡死了 25 分钟。

钉到 16k 立刻痊愈。这个坑跟 RAG 本身无关,但只要你在本地跑长上下文模型就会撞上,值得单独记一笔。

六、你需要多少篇笔记才够用?

不用一万篇。

从实测结果反推:真正决定成败的是「这段内容是不是你自己写的、是不是记了具体数字」。一百篇你自己写的、带结论带数据的笔记,就足够让一个小模型开口说人话——而一万篇收藏来的二手资料,可能还不如那一百篇管用。

更多真机实测视频,见 YouTube 频道「富爸爸AI实测」。

上一集:本地大模型能顶替付费 AI 订阅吗?四场真实工作实测

下一篇:AI 建的 3D 模型能直接打印吗?四件实测:首轮可打印率 25%,修复挽救率 0%

文章末尾固定信息
weinxin
我的微信
微信扫一扫
fubaba
  • 本文由 发表于 2026年8月10日 14:15:29
  • 转载请务必保留本文链接:https://www.fubaba.org/90.html
评论  0  访客  0
匿名

发表评论

匿名网友

:?: :razz: :sad: :evil: :!: :smile: :oops: :grin: :eek: :shock: :???: :cool: :lol: :mad: :twisted: :roll: :wink: :idea: :arrow: :neutral: :cry: :mrgreen: