本篇导读
预计阅读时间:6 分钟。读完你会搞明白三件事:聊天框的天花板在哪、Agent 是个啥、以及它能替你做哪些聊天框做不了的事。
先问个问题:你现在是怎么用 AI 的?
大概是这样。打开一个聊天框,可能是豆包,可能是千问,也可能是 DeepSeek。打字,回车,看它吐一大段回复。觉得有用就复制走,觉得没用就换个问法再来一遍。
这是绝大多数人的用法。但我想指出一个事实:这个用法已经到顶了。 不是 AI 到顶了,是「聊天框」这个东西到顶了。
聊天框的三个限制
聊天框只能「说」,不能「做」。你问,它答,仅此而已。具体来说,有三个绕不过去的限制:
- 它碰不到你的电脑。 你让 AI 写个自动整理文件的脚本,它给你一大段代码,然后呢?你自己新建文件、粘贴、保存、打开终端去跑。报错了再复制回去问它,它再给一版,你再粘贴再跑。从头到尾,出主意的是它,干活的是你。
- 它记不住你。 今天费半天劲给它讲清楚的规则和背景,明天新开一个对话就归零,一切都得重来。
- 它出不了聊天框。 查资料、填表格、批量重命名几百个文件——这些要「动手」的事,它都干不了,只会回复「建议您手动操作」。
Agent:从出主意到直接做
AI Agent,中文叫智能体,解决的就是这三个问题。你可以把它理解成:给 AI 装上了手和脚。
还是刚才那个例子。这回你对 Agent 说:「把这个文件夹里 200 张照片按拍摄日期整理好。」
它不是给你一份操作指南让你照着做,而是自己动手:打开文件夹,读取文件信息,建目录,逐个挪文件。中间哪步出错了它自己调整,完成后向你汇报结果。
你的角色从这里开始改变:以前你负责执行,AI 负责出主意;现在 AI 负责执行,你只负责提需求和验收。
再拿「做个个人IP展示页面」对比一下:
- 聊天框:给你一大段 HTML 代码,你自己粘贴保存,浏览器打开一看样式乱了,复制回去问,再改再粘贴,来回五六轮还不一定能看。
- Agent:你说一句「帮我做个能展示作品集的个人主页」,它直接在你电脑上建文件、写代码、打开浏览器给你看效果。你说标题字体大一点,它改完自己刷新。
前者你是在复制粘贴,后者你是在用 AI 做事。这本教程教的从头到尾都是后者。
用之前,先认清它的脾气
Agent 能干活了,但它脑子里的 AI 和聊天框里的是同一个东西,有三个脾气要提前知道:
- 它可能会一本正经地编造。 使用低级模型,问它冷门事实,它可能给出一个看起来很可信但纯属虚构的答案。
- 它不知道最新的事。 它不了解当天的新闻和实时信息,除非给它联网能力(后面章节会讲怎么给)。它知道的信息截止于模型训练的时间。
- 它习惯顺着你说。 你说「我觉得 A 方案好」,它多半会附和。想听真话,就直接问「请指出这个方案的问题」。或者添加相关的约束规则和技能来规避这一类问题。
所以最健康的分工是一句话:AI 负责数量,你负责质量。 让它写初稿、跑腿、干重复活,你负责判断和把关。全盘照收会退步,完全不用会落后。
下一章
那 Agent 凭什么能自己动手?它和聊天框里的 AI 到底是不是有什么不同?
下一章把这个黑盒拆开,里面就一个公式:Agent = Model + Harness。搞懂它,后面所有的配置、调教和实战你都会觉得顺理成章。
