
agent-browser详细介绍
agent-browser是Vercel Labs推出的浏览器自动化CLI工具,专为AI代理设计,而非传统测试场景。跟Playwright、Puppeteer这类面向工程师写测试脚本的工具不同,agent-browser从设计之初就在解决一个问题:AI代理怎么才能高效、可靠地操作网页,同时不把宝贵的上下文窗口撑爆。
它最核心的设计是snapshot命令。执行后返回的不是完整DOM,而是页面的accessibility tree,每个可交互元素会带一个唯一ref,比如@e1、@e2。这个输出只有200到400个token,而完整DOM动不动就3000到5000个token。AI代理拿到这个精简的快照后,直接用ref去点击或填表,不用再费劲解析CSS选择器或XPath。有开发者对比过,同样一个任务,用Playwright MCP跑要花约10万token,用agent-browser只要7千左右。
命令覆盖很全,导航、表单、截图、网络拦截、存储、标签页、frame、调试加起来50多个。会话管理支持同时跑多个隔离的浏览器实例,每个有自己的cookie和登录态。还有一个实用的功能是直接用–profile复用本地Chrome的登录状态,不用为了爬一个需要登录的网站专门写一遍认证流程。网络层面支持路由拦截、mock响应、导出HAR文件。调试工具也配齐了,console日志、JS错误捕获、DevTools trace、性能剖析都能做。
底层是原生Rust写的CLI,跨平台支持macOS、Linux、Windows。安装方式很灵活,npm全局安装、brew、或者直接npx跑都行。跟Claude Code、Cursor、GitHub Copilot、OpenAI Codex、Google Gemini这些主流AI编码工具都能无缝配合。项目基于Apache 2.0开源协议,目前GitHub上已有超过3.9万stars。
agent-browser的定位非常清晰,它不是给QA工程师写端到端测试用的,而是给AI代理一个稳定、高效、省token的浏览器操作接口。如果你需要的是跨浏览器兼容性测试、复杂断言、或者维护一套长期运行的测试脚本,Playwright仍然是更好的选择。但如果你在构建一个需要跟网页打交道的AI代理,或者想让Claude Code帮你自动完成某个网页操作流程,agent-browser可能是目前最对路的工具。
agent-browser的核心功能
- Agent优先的快照输出:snapshot命令返回accessibility tree而非完整DOM,输出仅200-400 token,大幅降低LLM上下文消耗。
- 基于Ref的确定性元素选择:快照中每个元素分配唯一ref(如@e1),交互时直接引用ref,无需依赖脆弱的CSS选择器或XPath。
- 50+浏览器自动化命令:覆盖导航、表单填写、截图、网络请求拦截与mock、存储操作、标签页管理、frame切换、调试等完整场景。
- 多会话隔离管理:支持同时运行多个独立浏览器会话,每个会话拥有独立的cookie、存储和认证状态。
- Chrome Profile复用:可直接复用本地Chrome的登录态(–profile参数),避免重复处理认证流程。
- 网络控制与HAR导出:支持按URL模式或资源类型拦截请求、mock响应体,并可导出完整的HAR文件用于分析。
- 内置录制与调试工具:支持WebM视频录制、WebSocket实时流式传输、Chrome DevTools trace捕获、console日志与JS错误查看。
- React与Web Vitals检测:支持React组件树检查、渲染性能分析、Suspense边界分类,以及LCP、CLS、INP等Core Web Vitals测量。
agent-browser的价格详情
免费权益:
agent-browser完全免费且开源,基于Apache 2.0许可证。无需任何付费订阅或按量计费。价格可能随官方调整。
收费模式:
| 套餐 | 价格 | 包含内容 |
|---|---|---|
| 开源免费版 | 免费 | 全部50+浏览器自动化命令 原生Rust CLI,跨平台支持(macOS/Linux/Windows) 多会话隔离管理 CDP模式直接访问Chrome DevTools Protocol WebSocket实时流式传输 快照diff与性能剖析 iOS Simulator支持 Chrome与Lightpanda双引擎支持 与Claude Code、Cursor、GitHub Copilot等AI代理集成 |
agent-browser的应用场景
- AI代理驱动的网页自动化:让Claude Code或自定义AI代理通过agent-browser执行网页导航、数据提取、表单提交等任务。
- LLM应用的Web数据采集:用snapshot命令高效提取网页结构化数据,用于RAG系统的知识库构建或模型训练。
- 自动化UI回归测试:对Web应用进行无头浏览器自动化测试,用快照diff检测页面变化。
- CI/CD中的浏览器任务:在持续集成流水线中运行agent-browser,执行登录验证、截图留存、网络请求审计等自动化步骤。
- React应用性能分析:在开发或测试环境中用react命令检查组件树、记录渲染次数、测量Core Web Vitals。
- 爬虫与数据抓取:需要登录态或JavaScript渲染的复杂爬虫场景,用–profile复用浏览器登录状态绕过认证。
agent-browser的适用人群
- AI工程师与ML工程师:构建需要与网页交互的AI代理或LLM应用,agent-browser的token高效输出和ref机制能显著降低运行成本。
- 前端与全栈开发者:在开发过程中用agent-browser进行自动化测试、性能分析或React组件调试。
- DevOps与SRE工程师:在CI/CD流水线中集成浏览器自动化任务,如部署验证、监控巡检等。
- 产品经理与技术负责人:评估AI驱动Web自动化方案时,agent-browser的开源属性和与主流AI工具的无缝集成是重要考量因素。
同类工具对比
| 对比维度 | agent-browser(本工具) | Playwright | browser-use | browser-harness | playwright-mcp |
|---|---|---|---|---|---|
| 定位 | 专为AI代理设计的浏览器自动化CLI,核心差异是“accessibility tree + ref”的低token输出方案 | 微软开源的跨浏览器端到端测试框架 | AI代理浏览器自动化工具,94k GitHub stars | AI代理浏览器自动化工具,12.6k stars | 微软推出的Playwright MCP服务器 |
| 核心优势 | snapshot输出仅200-400 token,比完整DOM方案节省10倍以上上下文;ref机制提供确定性元素选择,避免CSS选择器脆弱性;原生Rust CLI确保命令解析和执行速度;支持50+命令覆盖完整浏览器操作;多会话隔离、Chrome profile复用、CDP模式等高级功能齐全;Apache 2.0开源,GitHub 3.9万+ stars | 支持Chromium、Firefox、WebKit三引擎,API成熟,社区庞大,适合编写维护性强的测试脚本 | 社区活跃,专门面向AI代理设计 | 专注AI代理场景,轻量级 | 基于Playwright生态,可靠性高 |
| 主要短板 | 定位高度专注于AI代理场景,不适合需要跨浏览器兼容性测试或复杂断言的传统QA场景;目前主要面向开发者,缺乏图形化界面 | 输出为完整JSON/DOM,token消耗高,不适合AI代理的上下文效率场景 | 元素识别基于DOM索引,不如agent-browser的accessibility tree + ref方案稳定 | 生态和功能覆盖面不如agent-browser | token消耗高(同任务约10万token vs agent-browser的7千),上下文效率不如agent-browser |
| 价格 | 完全免费(Apache 2.0开源) | 开源免费 | 开源免费 | 开源免费 | 开源免费 |
| 适合谁 | 构建AI代理或LLM应用、需要高效token利用和稳定网页操作能力的开发团队 | 需要跨浏览器兼容性测试和长期维护的测试脚本 | 需要AI代理操作网页的开发者 | 轻量级AI代理浏览器自动化需求 | 已深度使用Playwright且对token消耗不敏感的场景 |
相关导航


Ollama

Vercel

Kubernetes

文心快码

B.AI

飞桨AI Studio

