128G 顶配 Mac 跑通义千问 Qwen3.8 四场实验:满载 30 分钟频率腰斩、对话养到 8 万 token 开口 28 秒、缓存一断 11 万字重读 166 秒,同任务订...
Ollama 量化是什么?Q4/Q8/FP16 同机实测:体积差 3 倍,分数一分没差
同一个 qwen3:8b 的 Q4/Q8/FP16 三档同机实测:7 题上锁判分全满分;乘法爬坡 Q4 推理死循环;同内存 30B-Q4 比 8B-FP16 快 4.8 倍。
Ollama 长上下文实测:26 万 context 真能用吗?11 万字读完要 34 分钟
Ollama 26 万上下文实测(大海捞针法):1k 到 11 万字全部答对,记性没问题;但 11 万字光 prefill 要 34 分钟——长度涨 13 倍等待涨 180 倍,还...
Mac 本地大模型速度实测:Ollama 跑 8B/30B/70B,30B 反而比 8B 快 79%
M5 Max 128G Mac 用 Ollama 实测 8B/30B/70B 三档本地大模型:70B 只有 3.64 字/秒,30B MoE 却比 8B 快 79%。决定速度的不是...
NotebookLM 实测:它最强的优点,恰恰是它的死穴(第二大脑误区)
NotebookLM 实测:跨文档问答、引用回链、AI 播客都很强,且实测证明它不编造资料外内容;但「只认你喂的资料」恰恰让它当不了第二大脑——资料过期它跟着错。

