打开任何一个 AI 排行榜全是分数。可你要的不是分数,是这条微信写不写得像人、这张表算不算得对。普通人选 AI 像选手机:先问自己拿它干什么,再看配置——排行榜真的可以不看。
▶ 视频直达:https://youtu.be/U5BadEbfFPg
三问自测卡
- 你主要拿它干什么?写消息、改文案,还是读长文件
- 中文多,还是英文多?
- 愿不愿意每个月花钱?
答完三问就能对号入座。但表是我做的,凭什么信?所以我先把七个 AI 考了一遍。
考场
七个选手:ChatGPT 旗舰档(GPT-5.5);Claude 小档 Haiku 4.5 / 中档 Sonnet 5 / 旗舰档 Opus 5;谷歌 Gemini 小档 3.5 Flash-Lite / 中档 3.7 Flash / 旗舰档 3.1 Pro。全部用我自己已有的账号,不新开号。
五道日常题:① 给房东写条微信(热水器坏三天了,请这周内修)② 产品介绍改成朋友圈口吻 ③ 给我妈解释「云盘是什么」④ 流水账做成表并算总额(真值 1097.5)⑤ 给国外客户翻一条发货短信。判分标准提前写死并 sha256 上锁,每档只答一次,不重来不挑答案。
成绩单(每题 0/1/2,满分 10)
| 档位 | 写消息 | 改文案 | 解释词 | 做表 | 翻译 | 合计 |
|---|---|---|---|---|---|---|
| Claude 小档 Haiku | 2 | 2 | 2 | 2 | 2 | 10 |
| Claude 中档 Sonnet | 2 | 2 | 2 | 2 | 2 | 10 |
| Claude 旗舰档 Opus | 2 | 0(丢了「12 小时」) | 2 | 2 | 2 | 8 |
| Gemini 小档 Flash-Lite | 2 | 2 | 2 | 1(总额算成 497.5) | 2 | 9 |
| Gemini 中档 Flash | 2 | 2 | 2 | 2 | 0(拒答) | 8 |
| Gemini 旗舰档 Pro | 2 | 2 | 2 | 2 | 2 | 10 |
| ChatGPT 旗舰档 GPT-5.5 | 2 | 0(丢了「12 小时」) | 2 | 2 | 2 | 8 |
两个小档合计只丢 1 分,三个旗舰档合计丢 4 分。
几个细节:Claude 的中档和旗舰档自作主张给房东起了名字(「王先生」「张哥」),我可没说过房东姓什么;谷歌最小档做表算错总额,还顺手帮我生成了一个 Excel 文件——算错的表做得越漂亮越危险;谷歌中档翻译直接回「我只是一个语言模型,无法提供这方面的帮助」,同一家小档和旗舰都翻得挺好——拒答不是能力问题,是运气问题。
难题:租房合同六处坑
一份 1200 字租房合同(自造),埋了 6 处对租客不利的条款,让它们全挑出来:
| 档位 | 命中 | 编造 | 耗时 |
|---|---|---|---|
| Claude 小档 | 6/6 | 0 | 37 秒 |
| Claude 中档 | 6/6 | 0 | 32 秒 |
| Claude 旗舰档 | 6/6 | 1(举例提到合同里没有的「锅具」) | 83 秒 |
| ChatGPT 旗舰档 | 6/6 | 0 | 44 秒 |
| Gemini 小档 | 5/6 | 0 | — |
| Gemini 中档 | 4/6 | 1(「累计损失数万元」说过头) | — |
| Gemini 旗舰档 | 5/6 | 1(把第十条和留宿超期硬挂一起) | — |
我原本以为小档在这题会被甩开,结果 Claude 小档六处全中一处没编,答案跟旗舰一样多,时间只有旗舰的一半不到。差距不在档位大小,在哪一家。
三档判决表
- 免费够用:偶尔写条消息、解释个词——五道日常题里小档和旗舰档的翻车次数一样多
- 一家就够:每天都用,选一家付一份钱,别三家都订。选哪家?拿你自己的一件活去它家小档试一次,过了就是它
- 该上付费:读长文件、改代码、批量干活——这时候买的不是「更聪明」,是不用等、不拒答、不限次数
模型之间百分之九十的差别你根本用不到;你用得到的那百分之十,翻车的往往是最贵的那个。
我先站队:普通人根本用不到旗舰模型。不同意的来评论区,把你的活说一句,我拿去三家真跑一遍。
下一篇:AI 做 PPT 能直接拿去汇报吗?裸喂 8·7·5,贴一张交代单 8·8·8
更多真机实测视频,见 YouTube 频道「富爸爸AI实测」。
上一篇:本地 AI 第一次能看视频?Qwen3.8-27B 实测:六道考题 5 全对 1 翻车(Ollama 一行命令)


评论