# Agent终于不用每次重学网页:BrowserAct把浏览器流程变成可复用 Skill
**作者**: AFei Liang
**日期**: 2026-07-15T12:23:20.000Z
**来源**: [https://x.com/afei_AI/status/2077368415095058824](https://x.com/afei_AI/status/2077368415095058824)
---

让 Agent 打开网页、点击按钮、抓取信息,已经不算什么新鲜事
真正麻烦的是:今天跑通的流程,明天还能不能继续用?
页面加载方式变了,登录状态丢了,验证码出现了,关键词换了,原本那套自动化就可能重新变成一次性脚本
我最近看到 BrowserAct 觉得它值得拆开看的原因,不是“又多了一个浏览器自动化工具”,而是它把问题往前推了一步:
网页操作能不能从一次执行,沉淀成 Agent 下次可以直接调用的能力?

## Agent 会点网页,不等于会稳定做事
我以前也见过不少让 Agent 操作浏览器的方案
有的让 Agent 直接读取网页,有的让它临时写 Playwright 或 Selenium 脚本,还有的用 RPA 把固定步骤串起来
这些方案都能解决一部分问题,但网页任务一复杂,差距马上就出来了
页面内容可能要等 JavaScript 执行后才出现
流程可能依赖登录、Cookie、SSO 或扫码
某个页面今天能点通,换个关键词、换个账号,明天就要重新探索
所以我现在判断浏览器自动化,看的不只是“能不能点击”,还要看三件事:
- 能不能稳定进入真实页面
- 中途需要人接手时,能不能保留现场
- 一次跑通后,能不能留下可复用的流程

这也是 BrowserAct 有意思的地方
## 先把三个卡点看清楚
理想中的浏览器任务很简单:打开网页,输入关键词,复制结果
真实网站通常不是这么配合的

1. 页面不是静态文档
很多网站打开时只返回一个页面框架,真正的数据要等浏览器继续请求、渲染后才出现
Agent 如果只读取 URL 内容,拿到的可能不是用户眼前看到的页面
它还要处理下拉菜单、分页、详情页跳转、返回列表和异步刷新
2. 环境本身就是任务的一部分
网站可能检查浏览器特征、插件、图形能力和网络指纹,也可能要求验证码、扫码登录、企业 SSO 或短信确认
完全无人值守听起来很理想,但真实工作流里,经常需要人在某一个节点确认一下,再把任务交回给 Agent
3. 一次成功,不代表能复用
如果每次都让 Agent 临场分析页面、临场写脚本、临场猜分页方式,浏览器自动化永远停在“这次能跑”的阶段
对 Agent 来说,真正有价值的不是某一次抓到了什么,而是它有没有学会一套以后还能重复执行的方法
## BrowserAct 把浏览器变成执行层
BrowserAct 是一个面向 AI Agent 的浏览器自动化 CLI

乍一看,它很像“让 Agent 点网页”的工具
但它的重点不只是点击、输入、截图和提取文本,而是把浏览器环境也纳入了 Agent 的工作流
过去的自动化脚本通常把浏览器当成一个页面操作界面:找到元素,然后执行动作
Agent 面对的却是另一种问题:页面要不要继续等,登录状态能不能保住,这是不是一个真实浏览器,多个任务会不会抢同一份状态
BrowserAct 试图把这些条件一起管理起来

隐身浏览器、代理、浏览器身份、Cookie、Session,单独看像一堆功能名
放在一起,其实都在回答一个问题:
Agent 进入网页时,能不能拥有稳定的身份和上下文,而不是每次都启动一个临时脚本
它还有一个比较务实的设计:不把人工介入当成异常

遇到验证码、扫码或企业登录时,人可以先接手处理,完成后 Agent 继续使用原来的浏览器状态往下走
任务不是失败了,只是在中间留下了一个人工接力点
另一个关键点是身份和任务分离

浏览器更像账号身份的容器,Session 更像一次任务的工作区
同一账号可以并行处理多个任务,不同账号的登录状态、Cookie、代理和浏览器配置也可以隔离开
这对长期运行的 Agent 很重要,因为它往往不只处理一个页面动作,而是同时推进多条任务
## 它不是一个 CLI,而是一条两层工作流
BrowserAct 的底层是 CLI,上层配了两个 Skills

CLI 负责执行浏览器动作:打开网页、点击输入、读取页面内容、观察网络请求
但 Agent 还需要知道什么时候该等页面稳定,什么时候该停下来让人处理验证,什么时候应该保存原始结果
这就是 browser-act Skill 的作用
> https://github.com/browser-act/skills/tree/main/browser-act
它把 CLI 的能力整理成一套 Agent 可以遵循的操作流程
如果只是完成一次任务,到这里已经够用
但如果这套流程以后还会反复出现,就应该继续使用 browser-act-skill-forge
> https://github.com/browser-act/skills/tree/main/browser-act-skill-forge
它会根据已经探索过的结果,把网站里的稳定路径整理成新的 Skill
这一步,才是 BrowserAct 和普通浏览器自动化之间最值得注意的差异
## 案例:把 Product Hunt 日榜变成每周选题表
主要任务:每周从 Product Hunt 日榜里筛出值得跟进的 AI 和开发者工具,整理成一份选题表
这个任务看起来只是“抄榜单”,实际要处理的东西不少:榜单页面动态加载,分类和日期需要切换,产品详情页还要补齐简介、官网、GitHub 和讨论信息
首先安装 Browser Act skill 并测试可用
```
帮我安装 browser-act skill:https://github.com/browser-act/skills/tree/main/browser-act
安装完成后,请验证CLI是否可用
```

然后下发选题任务:
```
帮我用 Browser Act 整理 Product Hunt 的 AI 和开发者工具榜单
请打开 https://www.producthunt.com/ ,查看指定日期的日榜,并完成:
1. 筛出 AI、Developer Tools 相关产品
2. 记录产品名、简介、榜单位置、投票数、评论数、发布者和官网
3. 打开产品详情页,补充 GitHub 或文档链接
4. 标记适合做教程、测评、新闻跟进的选题
5. 保存原始数据,并生成一份 Markdown 选题表
```
它应该先观察榜单如何加载,再处理日期、分类、分页和详情页跳转
最终生成原始数据和选题表文件:

保留产品原名、榜单位置、投票数、评论数、官网和 GitHub 链接

这样后面写文章时,能回到产品页复核,不会把 Agent 的一句总结当成事实
## BrowserAct 在这个任务里做了什么
把这个新案例拆开,我觉得它主要补了四个缺口
1. 让 Agent 进入真实榜单页面
Product Hunt 的榜单不是一张永远不变的静态表,日期、分类和详情内容都可能需要继续加载
BrowserAct CLI 运行在真实浏览器里,Agent 可以等待页面稳定、观察筛选状态,再决定下一步怎么取数据
2. 不必在浏览器外猜页面结构
榜单页负责排序和筛选,详情页负责产品信息,官网和 GitHub 又可能是外链
在浏览器上下文里,Agent 可以沿着用户真实点击路径确认字段来源,而不是在外部脚本里凭经验拼参数
3. 给选题留下证据链
产品名、榜单位置、投票数、评论数、发布时间、产品简介和链接都可以保存到原始文件里
原始数据文件让选题表不再只是几句主观推荐
4. 把一周的整理流程变成新的 Skill
普通自动化把本周榜单整理完,任务就结束了
BrowserAct 还可以继续把日期切换、分类筛选、详情页补全和选题判断封装起来
## Skill Forge:复用的不是代码,而是方法
当这条流程已经跑通,我会继续让 Agent 执行:
```
/browser-act-skill-forge 帮我把刚才这套 Product Hunt 选题流程封装为一个 Skill,支持输入日期和产品分类,输出带来源链接的 Markdown 选题表
```
Forge 需要从这次探索里抽出几类稳定信息:
- 目标网站和业务意图:Product Hunt 榜单选题
- 稳定操作路径:日榜、日期、分类、详情页和外链
- 可复用参数:日期、分类、产品数量、选题类型和输出目录
- 输出格式:SKILL.md + scripts,以及带来源链接的选题表

生成的 Skill 叫 product-hunt-topic-research,它封装的就不只是抓榜单代码,而是一套内容工作流:
- 先按日期和分类收集候选产品
- 再补齐详情页字段和官方链接
- 然后按教程、测评、新闻三种方向做初筛
- 最后保存原始数据和选题结果
真正该复用的是方法,不是某一周的榜单结果
## 换一个分类,流程需要重学吗
可以把输入从“AI 和开发者工具”换成“设计工具”或“生产力工具”,日期也换成新的周次
这时变化的只是输入参数,榜单路径、详情页字段、链接留存和 Markdown 输出方式都可以继续复用

只要流程中的参数边界和输出格式写清楚,后续任务就有了可检查的执行标准
同样的思路,也可以用于竞品价格监控、招聘信息跟踪、商品评论分析、论坛口碑巡检和榜单日报
前提是:这件事能在浏览器里稳定完成,并且你愿意把它整理成明确的方法
## 它和传统方案怎么分工

所以,BrowserAct 不是要替代所有浏览器工具
它补的是 Agent 最容易缺的四段:稳定执行、状态管理、结果复核和流程复用
## 最后
BrowserAct 这条链路可以简单记成三层:
- BrowserAct CLI:负责真实浏览器执行
- browser-act:负责让 Agent 按流程调用 CLI
- browser-act-skill-forge:负责把跑通的网站流程沉淀成新的 Skill
product-hunt-topic-research 只是一个具体产物
它表面上是一份 Product Hunt 选题表,往后换日期、换分类,同一条路径依然能继续工作
这类工具真正要解决的,也许从来不是“让 Agent 会点网页”
而是让 Agent 做过的一件事,下一次还能直接调用
相关地址:
- 官网:https://www.browseract.ai/coding
- GitHub:https://github.com/browser-act/skills
## 相关链接
- [AFei Liang](https://x.com/afei_AI)
- [@afei_AI](https://x.com/afei_AI)
- [312](https://x.com/afei_AI/status/2077368415095058824/analytics)
- [https://github.com/browser-act/skills/tree/main/browser-act](https://github.com/browser-act/skills/tree/main/browser-act)
- [https://github.com/browser-act/skills/tree/main/browser-act-skill-forge](https://github.com/browser-act/skills/tree/main/browser-act-skill-forge)
- [https://www.browseract.ai/coding](https://www.browseract.ai/coding)
- [https://github.com/browser-act/skills](https://github.com/browser-act/skills)
- [Upgrade to Premium](https://x.com/i/premium_sign_up)
- [8:23 PM · Jul 15, 2026](https://x.com/afei_AI/status/2077368415095058824)
- [312 Views](https://x.com/afei_AI/status/2077368415095058824/analytics)
---
*导出时间: 2026/7/15 22:08:47*