Skip to content

本篇导读

预计阅读时间:8 分钟。读完你会明白四个核心概念:token、上下文窗口、模型版本和计费规则。知道这些,你看任何模型介绍都不会发懵。

模型接通了,能用就行了吗?不行。下面四个概念是你绕不开的,每个都直接影响体验和费用。放心,都不难。

Token:模型的计量单位

模型不是按「字」处理文字的,而是按 token。一个 token 大约相当于一到两个汉字,或者三到四个英文字母。

为什么你要关心这个?因为模型的一切都按 token 计量:一次对话能处理多少、收费多少、响应快慢,全都换算成 token 算。你以后看到的「上下文 128K」「输入 2 元/百万 token」,说的都是它。

有个粗略的心算方法:一篇 1000 字的中文文章,大约折合五百到一千个 token。

上下文窗口:模型的短期记忆上限

模型每处理一次请求,能「看到」的文字总量有一个硬上限,这就是上下文窗口(context window),以 token 计。

它的体验上的意义是:和模型的所有交流,都是在往这个窗口里塞纸条。 你说的话、它的回复、你给的文件内容、工具返回的结果——全部算在里面。窗口塞满会发生什么?最早的记录会被挤出去,模型就开始「忘事」。

不同模型的窗口差别很大,从十几万 token 到上百万 token 都有。对新手的意义就一句话:单次任务别贪太多。让 Agent 一次处理一个文件夹没问题,让它一次读完你整个硬盘不现实,也不是钱的问题,是窗口装不下。

而任务太大时怎么办?这正是第 3 章要讲的记忆系统和任务拆解存在的意义。

模型版本:同一个名字,不同档位

你可能见过这样的名字:deepseek-v4-pro、gemini-3.8-flash。规律是:

  • 旗舰版(不带后缀或带 pro/max 等):能力最强,价格最贵,适合复杂任务,比如大型代码项目、难度高的分析。
  • 轻量版(flash/lite/mini 等):速度快、价格低一个量级,适合简单问答、格式转换这类「杀鸡不用牛刀」的活。
  • 推理版(reasoner/thinking 等):回答前会先「打草稿」一步步想,适合数学、逻辑、复杂决策,但更慢更贵。
  • 重要提醒:后缀规律只在同一家厂商内部成立,不能拿来跨厂商比较。比如上面这两个例子,gemini-3.8-flash 的能力就明显超过 deepseek-v4-pro。当前国内顶尖模型距离国际顶尖模型仍然有一部分能力差距。

计费:钱花在哪

按 token 计费的服务,账单通常分成四个价目,先讲前两个基本的:

  • 输入:你发给模型的内容,按此计价,价格便宜。
  • 输出:模型生成回给你的内容,按此计价,价格贵,常常是输入的几倍——因为生成比读取「费力」得多。

另外两个带「缓存」字样的价目,是省钱机制的一部分:

  • 缓存读取:同样的内容不用重新计算,直接读缓存,按此计价,价格最便宜。
  • 缓存写入:部分模型不存在这一价目。存在时,把一段会重复出现的内容(比如很长的系统提示、规则文件)提前存到服务商并标记好,存的时候按此计价。缓存写入只按总缓存 token 数计算一次,价格通常可以忽略。

一句话总结:输出最贵,输入次之,缓存读取最便宜。Agent 的 Harness 会自动利用缓存机制,让每轮重复喂给模型的固定内容(系统提示、规则文件等)走缓存价,替你省下不少开支。

另外要注意,Agent 场景下消耗比聊天框大得多——因为 Harness 每一轮都要把文件内容、工具结果喂给模型,token 用量可能是你打字的很多倍。这不是浪费,是它「看清现场」的必要开销,但你得心里有数。

所以中转站控制台里的用量统计要养成偶尔看一眼的习惯,既清楚钱花哪了,也能发现异常(比如 Key 泄露了)。可在「使用日志」页面看到每一次调用的细致参数和费用:https://api.viddsys.xyz/usage-logs/common

下一节

概念齐了。下一节我们把市面上几个主流模型拉到一起,横向比一比能力和风格,帮你建立「什么活用什么模型」的直觉。

Powered by VIDDsys