先给结论:AI 的自报不能当验收。同一个活,一句话交代给它拿了 90 分,可 17 个陷阱一个没发现,它还跟我说「170 个文件一个不少,全部归位」。加一段自检提示词之后,满分,17 个陷阱全抓。这段话在文末,可以直接复制走。
▶ 视频直达:https://youtu.be/SYhwTtAtstU
一、90 分的真相:它和一个机械脚本没区别
实验很简单:一个塞了 170 个文件的下载文件夹,里面埋了 17 个陷阱——存错后缀的文档、0 字节的音频、损坏的压缩包、未完成下载的 .part 文件、内容相同的重复副本。
第一次我只丢了一句话:「我的下载文件夹堆了一百多个文件,乱七八糟的,帮我整理好。」
它交回来 153/170,90.0 分。听着不错,可翻开细节:17 个陷阱一个都没识别,全按扩展名归了类。作为对照,一个纯看后缀的机械脚本能拿 92.4 分——也就是说,90 分不是聪明,那是一个很贵的机械规则。
最要命的是它的结语,自信地写着「170 个文件一个不少,全部归位」。如果我信了这句话,17 个坑就全留在那儿了。
二、只多加一段话:满分
第二次我没换模型、没加工具,只在同一个任务里多加了一段话——要求它交活之前先按标准自己检查一遍。
结果:170/170,100 分;17 个陷阱 17 个全抓,零丢失、零改名、零越界。它自己在报告里列出了哪些文件可疑、为什么可疑、拿不准的放哪了。
| 做法 | 总分 | 17 个陷阱 |
|---|---|---|
| 一句话粗指令 | 153/170(90.0%) | 0/17 |
| 纯看后缀的机械脚本 | ≈92.4% | 0/17 |
| 加上自检要求 | 170/170(100%) | 17/17 |
三、为什么这段话有效
它做的不是「让 AI 更努力」,而是把验收标准交给它,并要求它先自己走一遍验收。三件事缺一不可:
1. 逐条对照要求——不许笼统说「已完成」,每条都要说明怎么满足的
2. 主动暴露不确定——把拿不准的地方列出来,而不是蒙混过关
3. 不合格自己重做——发现问题当场改,改完再交
最后只报三件事:做对了什么、哪里不确定、改过什么。「哪里不确定」这一项最值钱——它把你原本要自己找的坑,提前摆到了台面上。
四、直接抄走(给任何 AI 都能用)
干完之后先别急着说"做完了"。交给我之前,按这三步自己过一遍:
1. 把我的要求逐条列出来,每一条说明你具体是怎么满足的。
2. 主动找出你拿不准的、可能出错的地方,列出来,不许藏。
3. 发现不符合要求的,直接改掉重做,改完再交。
最后只报三件事:做对了什么、哪里不确定、你改过什么。
整理文件、写代码、做表格、改文案都适用。它值钱的地方不是让 AI 变强,是让你不用再逐条复查。
这段话怎么来的、完整实验怎么跑的,看这篇:AI Agent 怎么搭?用 Claude Code 零代码真搭一个:一句话只值 90 分,岗位说明书才值 100 分
更多真机实测视频,见 YouTube 频道「富爸爸AI实测」。


评论