Skip to content

本篇导读

预计阅读时间:8 分钟。读完你会让 Agent 替你操作浏览器:打开网页、填表单、点按钮、抓取页面信息,并知道哪些活适合交给它。

这一章的任务从「查」升级到「操作」。先看最直观的:让 Agent 操控浏览器。

它怎么「看到」网页

Agent 操控浏览器,不是像人一样看屏幕,而是两种姿势:

  1. 读页面结构:直接读取网页的代码结构(HTML),拿到所有文字、按钮、输入框的信息。快而准,适合抓数据、填表单。
  2. 看屏幕截图:像人一样「看」渲染后的页面,再决定点哪里。适合页面结构复杂、必须靠视觉判断的场景。

你不用关心它用哪种,但知道这个有助于理解它的行为:有时它秒答,是在读结构;有时它慢几秒,是在看图。

第一次操控

来个简单的:「打开必应,搜索『GLM 模型』,告诉我前三条结果的标题和链接。」

你会看到它一步步执行:启动浏览器 → 打开网页 → 定位搜索框 → 输入 → 回车 → 读取结果 → 汇报。全程你只出了一张嘴。

这就是浏览器操控的全部体验:你描述目标,它完成所有点击。

适合交给它的浏览器任务

不是所有网页操作都值得自动化,判断标准是「重复 + 有明确步骤」:

  • 信息聚合:去五个网站查同一个东西,汇总成一张表
  • 填表:把手头的数据填进某个网页表单(报名、登记类)
  • 签到打卡类:流程固定的重复点击
  • 页面监控:盯着某个页面,内容有变化就通知你

反过来,需要人来做判断的(比如逛淘宝货比三家看眼缘)、有登录验证码拦截的、涉及支付操作的,要么不适合,要么需要你全程盯着。

两个必知的安全提醒

让 Agent 碰浏览器之前,这两条务必记住:

  1. 登录态就是身份。 它用的浏览器如果登着你的账号,它能以你的身份操作。涉及账号的自动化,只在你授权的任务里进行,用完留意一下账号动态。
  2. 支付环节必须人工。 任何牵扯到花钱的按钮(付款、确认订单),永远自己点。这是底线,没有例外。

排坑提示

浏览器自动化偶尔会「卡住」:页面加载慢、弹窗挡路、验证码拦路。遇到时别反复催它,直接问一句「现在页面上是什么情况」,让它描述看到的内容,问题基本都能定位。这也是和 Agent 协作的通用心法:它卡住时,让它汇报现场,而不是干着急。

下一节

浏览器是操控「外面的世界」。下一节回到自己电脑,干最实在的一件事:批量整理文件。

Powered by VIDDsys