本篇导读
预计阅读时间:7 分钟。读完你会了解主流模型各自的能力特点和使用手感,建立「什么任务选什么模型」的选择直觉。
到了选模型这一步。先声明一个前提:模型迭代很快,本篇讲的是相对稳定的特点和选择思路,具体型号和价格以各官网实时信息为准。
主流模型速览
国际御三家模型分别是:GPT(OpenAI)、Claude(Anthropic)、Gemini(谷歌)。综合来讲:GPT 各项均衡,性价比较高;Claude 能力顶尖,价格也最贵;Gemini 主打轻量高效,性价比极高。
GPT 系列(OpenAI):综合能力的标杆,生态最大,第三方工具对它的支持普遍最广。
Claude 系列(Anthropic):编码能力公认的第一梯队,「手感」好——代码整洁、听指令、会变通。Agent 场景下尤其受欢迎。
Gemini 系列(Google):轻量实力标杆,Flash系列即可达到国内旗舰级别模型能力。
国产三强同样实力过硬,而且价格普遍更友好:
Kimi 系列(月之暗面):长文本处理的早期标杆,中文场景表现出色,Kimi-K3 模型目前位居国内第一,但算力严重缺乏,生成速度极慢,偶尔可能出现不稳定的情况。
GLM 系列(智谱):国产旗舰之一,编码和智能体(Agent)任务能力强,有完整的档位线(旗舰/Flash 轻量版),Zcode 的原生搭配就是它,兼容性好。
DeepSeek 系列:以高性价比著称,Flash 版日常任务扎实,Pro 版推理能力强,价格较低,是很多人跑量的选择。
想看实时排名?
模型能力不是拍脑袋定的,行业里有公开的评测榜单。想随时了解各模型最新排名,推荐收藏这个网站:AIHOT 模型排行榜,各模型综合能力对比一目了然。
不过看榜时记住一句忠告(下面还会展开):榜单测的是通用能力,你的实际任务可能完全不同。
比能力更微妙的:风格
用过几个模型后你会发现,它们不只是能力数字的差别,风格差别更明显:
- 有的模型听话,你指哪它打哪;有的模型有主意,觉得你方案不对会顶回来。
- 有的代码注释详尽,有的极简;有的爱写长篇解释,有的惜字如金。
- 同一个问题,提问方式稍微变一变,有的模型表现稳定,有的忽好忽坏。
这些没有标准答案,适合自己的任务和口味就是好的。而好消息是:因为你在用 Harness(客户端),换模型的成本几乎为零——改一行配置的事,所以完全可以都试一遍。
建立你的选择直觉
给你三条实践经验,比任何跑分都管用:
- 复杂任务看专长,简单任务看价格。 改 bug、写大型功能,选编码口碑好的旗舰;批量改格式、翻译摘要,轻量版足够,成本差十倍。
- 一个任务,两个模型。 拿不准哪个好时,同一个问题发给两个模型,对比答案。这在客户端里切换很方便。
- 别迷信跑分榜。 榜单测的是通用能力,你的实际任务可能完全不同。各模型在前端、网安、设计等不同领域能力不同。自己的任务实测十分钟,胜过看榜一小时。
第 2 章收尾
到这里,你的第一个 Agent 已经完整跑起来了:客户端装好(身体),模型接通(大脑),还知道了怎么挑模型。
但是——它现在只是「能干活」,还谈不上「好使唤」。它不认识你、不懂你的习惯、每次都要从头交代。
第 3 章我们解决这些问题:深入 Agent 系统的内部,讲执行环境、规则文件、记忆、MCP 工具和技能。学完那一章,它才真正成为「你的」Agent。
