Skip to content

本篇导读

预计阅读时间:7 分钟。读完你会明白 Model 和 Harness 分别指什么、两者如何配合工作、以及为什么「换个外壳,同一个模型能力天差地别」。

上一章说了,Agent 能自己动手干活。那它到底是怎么构成的?这一章我们把这个黑盒拆开。

别紧张,不需要任何技术背景,这个公式一句话就能讲完:

Agent = Model + Harness

它俩一个是大脑,一个是身体。下面挨个说。

Model:负责思考的大脑

Model(模型)就是你已经熟悉的那部分——大语言模型。DeepSeek(深度求索)、GLM(智谱)、GPT、Claude,这些都是模型。

它的本职工作是:接收文字,预测并生成下一个字,循环往复,直到把话说完。因为「读完了几乎整个互联网的文本」,所以它能回答问题、写代码、做规划。

但模型本身有个致命的属性:它只能根据你的输入预测输出的内容。

你问它「现在几点了」,它不知道——它活在一个没有时间、没有网络、没有文件系统的真空里。它甚至分不清自己说的是事实还是编的。它就是个封闭的大脑,泡在营养液里,能想,不能动。

那怎样让它了解当前的情况,并把它融入到你的生产和工作环境中?这就需要第二个东西。

Harness:负责动手的身体

Harness 的原意是马具——套在马身上、让人能驾驭马的那套装备。在 AI 领域,它指包裹在模型外面的那一整套工程系统框架。

一个完整的 Harness 大概包含这些部件:

  1. 工具接口:把「读文件」「写文件」「执行命令」「搜索网页」封装成模型能调用的功能。模型输出一句「我要执行这条命令」,Harness 就真的去执行,然后把命令的执行结果重新返回给大模型。
  2. 对话循环:模型不是只跑一次就结束。Harness 维护一个「思考→行动→看结果→再思考→再行动」的循环,直到任务完成。这是 Agent 能「自己规划自己干」的核心机制。
  3. 上下文管理:模型一次能读的文字有限(这个上限叫上下文窗口,从十几万到上百万 token 不等)。Harness 负责决定每一轮把哪些信息塞给它,任务太大时还要做压缩和摘要。
  4. 安全机制:哪些操作直接放行、哪些需要同意、哪些坚决不能做,都由 Harness 把关。

所以回到公式:Model 出脑力,Harness 出手脚,两者合起来才叫 Agent。

为什么这个公式很重要

理解了这个拆分,你会突然看懂很多一直困惑的现象:

同一个模型,不同产品里表现天差地别。 你可能纳闷:都是同一个模型,为什么有的产品聪明能干,有的呆头呆脑?因为 Harness 不一样。好的 Harness 会把上下文喂得恰到好处、工具给得齐全、报错后带着模型一起排查;差的 Harness 只是把聊天框套了个壳。

「用 AI」和「用 Agent」是两种能力。 在聊天框里把模型用出花来,它也还是只能动嘴。选一个 Harness,模型立刻就能动手。这就是这本教程从头到尾在教的事。

模型可以换,本事跟着外壳走。 你在 Harness 里学会的调教方法——写规则文件、装工具、配记忆——换一个模型照样管用,因为这些都是 Harness 层面的东西。这个特性我们后面会反复用到。

主流 Harness 长什么样

目前市面上的 Harness,按形态大致分三类:

  • 命令行工具:在终端里运行,代表是 Claude Code CLI、Codex CLI、Hermes CLI。纯命令行界面,适合低交互、高内容的程序员类人群,当前已逐渐发展为 TUI 界面(可交互性更强,还是终端界面)。
  • 编辑器插件:长在 VS Code 这类编辑器里,代表是 Cline、Copilot。写代码场景很顺手。
  • 独立应用:单独的桌面或网页应用,代表是 ChatGPT(Codex)、Claude Code Desktop、Zcode(属于 GLM,本教程主要用它学习 Agent 系统)、DeepSeek Harness(DSH)、Hermes Desktop。上手门槛低,交互性更强。

下一章我们就把市面上主流的工具拉出来遛一圈,看看各自适合什么人。

Powered by VIDDsys