Brower Use + Page Agent:两个项目让AI操控浏览器进入「生产级」
## 本周AI开源的双子星
本周GitHub上有两个项目形成了奇妙的互补——把它们放在一起看,才能理解AI操控网页这件事已经走到了哪一步。
**Browser Use**(`browser-use/browser-use`):让AI Agent像人一样操作浏览器——点击按钮、填写表单、滚动页面、提取数据。本周持续霸榜Python Trending。
**Page Agent**(`alibaba/page-agent`):阿里出品,一个JavaScript实现的前端GUI Agent,能用自然语言操控任意网页界面。
> 这两个项目一个管「后端操控」,一个管「前端智能」。合在一起,就是一整套AI网页自动化的技术栈。
## Browser Use:把浏览器变成AI的手和眼
Browser Use的核心理念很简单:**让AI「看见」网页,然后「操作」网页**。
它通过三层架构实现了这个目标:
“`python
from browser_use import Agent
import asyncio
async def main():
agent = Agent(
task=”打开亚马逊,搜索’机械键盘’,把前10个结果的价格整理成表格”,
llm=”claude-sonnet-5″, # 支持任意LLM
)
result = await agent.run()
print(result)
asyncio.run(main())
“`
底层依赖Playwright驱动真实浏览器,上层用LLM理解页面结构和用户指令。和传统爬虫最大的区别在于:它不需要你写任何CSS选择器或XPath——AI自己就能理解「那个写着立即购买的橙色按钮」。
## Page Agent:阿里AI大军的新武器
Page Agent的独特之处在于它是**纯前端方案**——不需要后端服务,直接在页面中注入JavaScript AI Agent。
这意味着什么?**零部署成本。** 你不需要搭建任何服务器,不需要申请API密钥,加载一个JS脚本就能让AI操控任何网页。
阿里的GitHub仓库显示,Page Agent支持这些操作:
– 读取页面上的所有文本和按钮
– 模拟点击、输入、滚动
– 理解中文网页(这是Browser Use的弱项)
– 跨iframe操作
> 两个项目的Star数正在以每天数千的速度增长——开发者社区对这个方向的热情前所未有。
## 实际场景:这两个项目能帮你做什么
**场景1:竞品价格监控。** 用Browser Use每天早上自动打开5个电商网站,收集同类产品的价格变化,输出到飞书表格。
**场景2:批量数据录入。** 用Page Agent在有几千行表单的内部系统里自动填写数据——不需要API,不需要后台权限,只要有浏览器就行。
**场景3:自动化测试。** 让AI像真实用户一样走一遍注册→浏览→下单的完整流程,自动发现UI Bug和流程中断。
## 风险不容忽视
能力越强,责任越大。这两个项目也带来了新的风险:
– 网页自动化+AI = 新一代「高级爬虫」,网站的反爬机制可能失效
– 如果用于批量注册、刷单,法律风险极高
– AI可能误操作——比如不小心点了「删除账号」
Browser Use的README中郑重声明:请只在你有权限的网站上使用本工具。
## 选择指南:Browser Use vs Page Agent
两个项目看起来很相似,但实际定位不同:
| 维度 | Browser Use | Page Agent |
|——|:—:|:—:|
| 运行环境 | Python后端 | JavaScript前端 |
| 适用场景 | 批量自动化任务 | 单页面智能交互 |
| 中文支持 | 一般 | 优秀(阿里出品) |
| 部署复杂度 | 需要Python环境 | 引入JS即可 |
| 适合人群 | 后端开发/数据工程师 | 前端开发/QA测试 |
简单来说:如果你要做定时批量任务(每天自动抓取100个商品价格),用Browser Use;如果你要在某个内部管理系统中实现智能填表,用Page Agent。两者并不互斥——很多团队同时使用。
> 浏览器是互联网的「最后一公里」。当AI学会了在这最后一公里上走路,整个互联网的运作方式将发生根本变化。
🔥 关注LC智趣厅,每周精选改变游戏规则的开源项目
👇 你想用AI自动化什么网页操作?评论区开脑洞
