
Ethan Collins
Pattern Recognition Specialist

state、click和input工作,而云产品对非开发人员更易于使用。BrowserAct是一个面向AI的浏览器自动化平台,旨在将浏览器工作转化为可重复的工作流或代理调用命令。其产品比无代码爬虫更广泛:BrowserAct结合了真实浏览器执行、结构化提取、会话管理、调度、代理选项和人工接管。
重要的区别是BrowserAct有两种操作模式。BrowserAct Cloud允许用户描述一个目标并构建可重复使用的托管机器人。BrowserAct Skills仓库提供了一个MIT许可证的代理CLI和技能,本地AI代理可以从Claude Code、Cursor、Codex、Gemini CLI和OpenClaw等工具中调用。
这种划分使BrowserAct适用于两个受众。运营团队可以使用托管界面而无需维护浏览器基础设施,而开发人员可以将浏览器控制置于现有代理工作流中。
BrowserAct的主要功能集中在浏览器自动化演示变为重复工作流后出现的操作问题。
BrowserAct Cloud接受用户需要的网站、过滤器和字段的描述。该服务探索网站,构建可重复使用的机器人,并返回结构化数据或源文件。机器人可以重新运行、版本化、计划,并在网站更改时改进。
托管产品还支持CSV和JSON交付、API、网络钩子和与n8n、Make和Zapier等自动化平台的连接。这是希望获得输出而非浏览器控制框架的团队最易访问的BrowserAct途径。
本地BrowserAct CLI通过索引文本暴露浏览器状态。代理可以请求state,然后使用紧凑的指令如click 3或input 2 "value",而不是反复解析完整的页面表示。根据官方BrowserAct文档,运行时包括浏览器、会话、配置文件、网络捕获和HAR数据。
配套的技能也是版本感知的。其发现存根告诉代理加载运行时指令browser-act get-skills core --skill-version 2.0.2,因此操作指南可以匹配已安装的版本,而不是依赖几个月前复制的静态提示。
BrowserAct记录本地Chrome重用、新鲜的隐私导向会话和固定身份会话。这些模式满足不同的需求:重用现有登录、从干净状态开始,或为授权账户工作流维护一致的浏览器身份。
命名会话和单独的浏览器配置文件减少了并行任务之间的意外状态泄露。当多个代理同时运行时,这很重要,因为共享的cookie、标签或浏览器所有权可能会导致非确定性故障。
远程协助允许人类在工作流到达需要判断或手动完成的步骤时接管实时浏览器。代理在人类完成后可以继续。
BrowserAct的已发布技能还为敏感操作定义了确认闸门。浏览器创建、配置文件导入、代理更改、登录、表单提交和文件上传可能需要显式批准。这种设计是有用的,但团队仍应在其运行时周围实施自己的访问控制、日志记录和凭证策略。
云产品管理浏览器、调度、容量、代理选项和常见验证中断。BrowserAct还宣传在页面路径更改时的恢复和登录工作流的持久浏览器身份。
这些功能减少了基础设施工作,但不会使工作流完全无需维护。网站、权限、选择器、业务规则和认证系统仍可能更改。生产团队需要断言、运行历史、有限重试和不完整输出的警报。
BrowserAct采用混合的免费和积分模式,而不是单一的按座位定价。官方GitHub README表示基本的Chrome自动化可以在不注册的情况下运行,而注册用户可以获得额外的本地功能和最多五个隐身浏览器。托管代理和额外的隐身浏览器是付费服务。
BrowserAct定价页面目前列出了以下使用示例:
| 组件 | 公布的使用价格 | 覆盖内容 |
|---|---|---|
| 工作流步骤 | 每步骤5积分,标价从0.0032美元起 | AI任务执行和远程浏览器调度 |
| 本地指纹浏览器 | 100积分,标价从0.064美元每浏览器起 | 与代理分配隔离的配置文件 |
| 动态代理 | 每GB 5000积分,标价从3.20美元每GB起 | 针对国家的旋转或固定代理流量 |
| 云浏览器 | 限时免费 | 托管的后台浏览器执行 |
定价页面会变化,最低标价单位可能取决于积分包。现实的评估应重新运行代表性任务并记录步骤、浏览器配置文件、代理带宽、重试和计划运行频率。
BrowserAct的最佳评估是完成质量和维护成本,而不是单一的速度或成功率声明。该平台运行完整的浏览器工作流,因此性能取决于页面复杂性、网络地理、模型决策、认证和所需交互数量。
当团队希望一次性构建并重复运行相同的公共数据任务时,云产品在操作上更具吸引力。当AI代理需要在更长的工作流中检查状态并决定下一步时,代理CLI更灵活。
对于生产测试,至少测量五件事:任务完成率、模式完整性、中位运行时间、每次成功运行消耗的积分和需要人工干预的运行百分比。测试应包括页面更改和失败状态,而不仅仅是顺利路径。
BrowserAct有几个实际优势:
BrowserAct也引入了买家应了解的权衡。
首先,产品表面广泛。云机器人、代理CLI、技能、技能锻造、浏览器配置文件、工作流步骤和代理积分创建了比专注于抓取API更多的概念。团队应在比较功能之前决定需要哪种操作模型。
其次,AI指导的浏览器执行可能比确定性代码更不可预测。自然语言解释在页面变化时有帮助,但关键操作仍需要验证和显式停止条件。
第三,成本预测需要工作负载测试。积分消耗可能跨越工作流步骤、浏览器配置文件和代理流量,因此低单位价格不会直接揭示完成业务任务的成本。
最后,快速发展的工具需要版本纪律。在此次审查时,GitHub仓库显示超过5000颗星,但流行度无法替代安全审查、回归测试或支持评估。在生产中使用CLI和技能版本时应固定,并在部署前审查发布更改。
最佳的BrowserAct替代方案取决于您希望工具拥有多少基础设施和决策权。
| 选项 | 更适合以下情况 | 主要权衡 |
|---|---|---|
| Playwright | 工作流是确定性的,团队希望代码级浏览器控制 | 您需要承担更多的浏览器基础设施和维护 |
| Browser Use | Python开发人员希望一个以模型驱动浏览器任务为中心的开源代理框架 | 您需要组装更多的周围生产堆栈 |
| Browserbase | 团队希望将托管浏览器会话和开发人员API作为基础设施原语 | 代理行为和工作流设计仍然是独立的关注点 |
| Firecrawl | 主要需求是网页内容提取,而不是长时间的交互会话 | 它在操作复杂浏览器工作流方面关注较少 |
| BrowserAct | 您希望托管机器人或带有会话、身份、交接和提取功能的代理就绪CLI | 更广泛的平台和积分模型需要评估 |
BrowserAct并不是每个爬虫或测试套件的自动最佳替代品。如果API可以可靠地提供所需数据,它通常会比浏览器自动化更简单。如果工作流需要精确的断言和可重复的UI测试,Playwright可能提供更清晰的控制。当导航、变化的页面状态、会话隔离和代理决策成为核心时,BrowserAct会更具吸引力。
BrowserAct是四个群体的合理候选:
BrowserAct对于单次请求的API调用、小型静态爬虫或每个浏览器步骤必须保持完全确定的测试套件来说吸引力较小。它也不应被用于在未经授权的情况下访问私人或受限数据。技术能力不会创造权限;团队仍需对网站条款、隐私要求、数据最小化和凭证的安全处理负责。
BrowserAct是一个雄心勃勃的浏览器自动化平台,将无代码机器人构建与面向代理的本地运行时连接起来。其最强大的想法不是任何单个命令。而是尝试将浏览器执行、可重复状态、并行隔离、结构化输出、人工交接和托管基础设施打包成一个连贯的操作层。
云产品更容易采用,而代理CLI为技术团队提供了更具差异化的架构。当工作流已超越基本爬虫但不值得内部构建每个浏览器、会话和恢复组件时,应进行试用。在承诺之前运行代表性概念验证,并衡量完成的输出而非演示成功。
如果经过授权的BrowserAct工作流需要外部CAPTCHA处理路径,请参阅将BrowserAct与CapSolver集成的实用指南。该集成文章与本评论分开,并专注于实现细节。
问:BrowserAct是开源的吗?
BrowserAct的代理技能仓库在MIT许可证下开源,但BrowserAct Cloud及其托管基础设施是托管的商业服务。在评估部署要求时,请分别审查仓库和服务条款。
问:BrowserAct是无代码网络爬虫还是AI代理工具?
BrowserAct两者都是:BrowserAct Cloud提供基于提示的可重复使用的网络爬虫机器人,而代理CLI为AI代理提供直接的浏览器命令和会话控制。根据谁将操作工作流以及它必须运行的位置选择产品路径。
问:BrowserAct多少钱?
BrowserAct结合了免费的本地功能和基于积分的工作流步骤、浏览器配置文件和托管代理。由于总成本取决于任务,测试代表性工作流并计算每次成功结果的成本,而不是仅比较标价的单位价格。
问:BrowserAct与Claude Code、Cursor和Codex兼容吗?
是的。BrowserAct列出了Claude Code、Cursor、Codex、Gemini CLI、OpenClaw、OpenCode和VS Code作为兼容的代理环境,前提是代理可以加载技能并执行BrowserAct CLI。
问:BrowserAct比Playwright更好吗?
BrowserAct更适合代理驱动的工作流和托管浏览器操作,而Playwright通常更适合确定性的代码优先自动化和测试。正确选择取决于适应性决策或精确脚本控制哪个更重要。
问:BrowserAct可以同时运行多个浏览器任务吗?
是的。BrowserAct记录了独立浏览器、命名会话、隔离配置文件和同浏览器多会话操作。生产团队仍应为每个并行任务设置显式所有权、并发限制和验证检查。
TL;DR - AI代理验证码超时错误需要为页面就绪、工具传输、验证码处理和应用确认分配独立的资源。- 当页面URL、浏览器上下文、挑战或授权操作发生变化时,延迟结果必须被丢弃。- 对于临时传输故障,一次有限重试可能是合理的,但重复的检查点应开启审查路径。- 最终通过条件是原始应用状态,而不是未抛出异常。简介

当一个被授权的AI代理任务已经知道它遇到的reCAPTCHA并需要结构化的恢复调用时,mcp验证码求解器最为有用。CapSolver通过`capsolver-mcp`公开了官方的`solve_captcha`工具,而`detect_captchas`和`solve_on_page`则支持浏览器驱动的恢复。集成应将页面URL、reCAPTCHA版本、站点密钥、浏览器会话和授权操作保留为一个检查点。它还应停止而非猜测 when
