AI 说「干完了」别信它:一段自检提示词,让它自己挖出 17 个坑

fubaba AI工具评论105阅读模式

先给结论:AI 的自报不能当验收。同一个活,一句话交代给它拿了 90 分,可 17 个陷阱一个没发现,它还跟我说「170 个文件一个不少,全部归位」。加一段自检提示词之后,满分,17 个陷阱全抓。这段话在文末,可以直接复制走。

▶ 视频直达:https://youtu.be/SYhwTtAtstU

一、90 分的真相:它和一个机械脚本没区别

实验很简单:一个塞了 170 个文件的下载文件夹,里面埋了 17 个陷阱——存错后缀的文档、0 字节的音频、损坏的压缩包、未完成下载的 .part 文件、内容相同的重复副本。

第一次我只丢了一句话:「我的下载文件夹堆了一百多个文件,乱七八糟的,帮我整理好。」

它交回来 153/170,90.0 分。听着不错,可翻开细节:17 个陷阱一个都没识别,全按扩展名归了类。作为对照,一个纯看后缀的机械脚本能拿 92.4 分——也就是说,90 分不是聪明,那是一个很贵的机械规则。

最要命的是它的结语,自信地写着「170 个文件一个不少,全部归位」。如果我信了这句话,17 个坑就全留在那儿了。

二、只多加一段话:满分

第二次我没换模型、没加工具,只在同一个任务里多加了一段话——要求它交活之前先按标准自己检查一遍。

结果:170/170,100 分;17 个陷阱 17 个全抓,零丢失、零改名、零越界。它自己在报告里列出了哪些文件可疑、为什么可疑、拿不准的放哪了。

做法 总分 17 个陷阱
一句话粗指令 153/170(90.0%) 0/17
纯看后缀的机械脚本 ≈92.4% 0/17
加上自检要求 170/170(100%) 17/17

三、为什么这段话有效

它做的不是「让 AI 更努力」,而是把验收标准交给它,并要求它先自己走一遍验收。三件事缺一不可:

1. 逐条对照要求——不许笼统说「已完成」,每条都要说明怎么满足的
2. 主动暴露不确定——把拿不准的地方列出来,而不是蒙混过关
3. 不合格自己重做——发现问题当场改,改完再交

最后只报三件事:做对了什么、哪里不确定、改过什么。「哪里不确定」这一项最值钱——它把你原本要自己找的坑,提前摆到了台面上。

四、直接抄走(给任何 AI 都能用)

干完之后先别急着说"做完了"。交给我之前,按这三步自己过一遍:

1. 把我的要求逐条列出来,每一条说明你具体是怎么满足的。
2. 主动找出你拿不准的、可能出错的地方,列出来,不许藏。
3. 发现不符合要求的,直接改掉重做,改完再交。

最后只报三件事:做对了什么、哪里不确定、你改过什么。

整理文件、写代码、做表格、改文案都适用。它值钱的地方不是让 AI 变强,是让你不用再逐条复查。

这段话怎么来的、完整实验怎么跑的,看这篇:AI Agent 怎么搭?用 Claude Code 零代码真搭一个:一句话只值 90 分,岗位说明书才值 100 分

更多真机实测视频,见 YouTube 频道「富爸爸AI实测」。

上一篇:token 是什么?AI 按什么收你的钱:同一句话中文比英文贵 70%

下一篇:Claude 封号怎么办?我假装被封真演练了一遍:最坏损失=半天+一个月订阅费

文章末尾固定信息
weinxin
我的微信
微信扫一扫
fubaba
  • 本文由 发表于 2026年8月18日 13:44:23
  • 转载请务必保留本文链接:https://www.fubaba.org/113.html
评论  0  访客  0
匿名

发表评论

匿名网友

:?: :razz: :sad: :evil: :!: :smile: :oops: :grin: :eek: :shock: :???: :cool: :lol: :mad: :twisted: :roll: :wink: :idea: :arrow: :neutral: :cry: :mrgreen: