先给结论:Agent 和聊天 AI 的差别不在脑子,在有没有手和眼睛。
同一句话,我对 AI 说了两遍。第一遍它 52 秒回我一段代码,说「你自己跑」;第二遍 3 分钟过后,我那个堆了 200 个文件的文件夹,自己变干净了。
两遍之间,我只改了一个东西——给它工具。用的是同一个模型、同一句话,唯一的变量是它能不能真的动手。
下面是完整实验,包括它中途翻的那次车。
▶ 视频直达:https://youtu.be/qlmxkNdHvzo
一、考场:200 个乱名文件,埋 20 个陷阱
判分标准必须在开考前锁死,否则测出来的只是自我安慰。这次的判据先做了哈希公证,测试中不许改题。
沙盒里 200 个文件,名字全是 IMG_1320 这种没有意义的乱名,其中 20 个是陷阱:
- 扩展名伪装 12 个:叫
.txt的其实是图片,叫.jpg的打开是发票,叫.log的内容是表格 - 编码陷阱 3 个:GBK、UTF-16 的老文件,直接打开满屏乱码
- 损坏/空/未知 3 个:坏掉的压缩包、0 字节文件
- 无扩展名 / 双扩展名 2 个
只看扩展名分类,这 20 个必错。
二、聊天 AI:52 秒,交回一段代码
先看聊天窗里的 AI。它的回答其实很诚实:
我在聊天窗口里,接触不到你电脑上的文件。
于是它把整理思路写成一段脚本,让我复制过去自己跑。52 秒交卷,0 个文件被移动。
这不是它笨。它跟后面的 Agent 用的是同一个模型、同一个脑子。它缺的是手和眼睛——聊天 AI 的天花板就在这儿:你只能拿到答案,拿不到结果。
(补一句实验设计上的坑:单纯「禁用工具」并不能模拟聊天窗。CLI 环境里模型知道自己是 agent,会把工具被拒理解成权限故障,整段时间都在撞墙。必须显式改人设,告诉它「你是网页聊天窗助手、没有任何工具」,才能拿到干净的对照组。)
三、Agent 的第一个动作:不是回答,是看现场
同一句话原样发给 Agent。它没有立刻动手分类,而是先跑了一条命令,给 200 个文件挨个做体检——文件类型、真实内容、开头 300 字节,全部过一遍眼。
扩展名骗不了它。伪装成图片的发票当场现形,伪装成文本的图片也现形。
然后它干了一件我没想到的事:它没有一个一个去搬文件,而是当场写了一个分类程序,让程序去搬,200 个文件一次归位。
品一下这个动作——它不只是会用工具,它现场造了一个新工具。
四、它翻车了,但错误没流到我手里
说到这你可能觉得太顺了。别急,它真的翻了车。
有个叫「旧备忘」的老文件用的是 GBK 编码,它写的分类程序没认出来,把这个文件扔进了「待处理」。错了——那其实是一份会议记录。
重点在后面:它收尾的时候翻了一遍待处理,觉得这个文件不对劲,换了编码重新解析,认出是份纪要,把文件捞回去归了位。最后还在报告里主动坦白:中途误判过一个文件,已经核对纠正。
这才是 Agent 和聊天 AI 真正的分水岭。不是它更聪明,是它有闭环:做完自己检查,发现错自己修,修完了告诉你。错误被关在了循环里面。
五、成绩单
| 指标 | 结果 |
|---|---|
| 文件归类 | 200 / 200 |
| 陷阱识别 | 20 / 20(只按扩展名归类的基线:0/20) |
| 耗时 | 3 分 21 秒 |
| 过程 | 9 个回合,8 次工具调用 |
| 成本 | $2.61 |
它拿满分,不是因为聪明,是因为它真的一个一个打开看了。
六、所以,什么是 Agent
感知 → 行动 → 验证,循环起来,就是 Agent。
聊天 AI 只有嘴。Agent 有眼睛、有手,还有一根会回头检查的神经。
当然,手越大,缰绳越重要。这次实验我全程只放开了那一个文件夹,它也确实一步没出圈——权限边界该怎么划,是用 Agent 之前就要想清楚的事。
至于这双手是怎么装上去的,上一篇讲 MCP 的文章说得更细。
下一篇:AI Agent 怎么搭?用 Claude Code 零代码真搭一个
更多真机实测视频,见 YouTube 频道「富爸爸AI实测」。


评论