
Anh Tuan
Data Science Expert

state, click và input, trong khi sản phẩm Cloud dễ sử dụng hơn với người dùng không phải lập trình viên.BrowserAct là nền tảng tự động hóa trình duyệt hướng đến AI được thiết kế để biến công việc trình duyệt thành các quy trình tái sử dụng hoặc lệnh gọi bởi agent. Sản phẩm của nó rộng hơn một công cụ thu thập dữ liệu không mã hóa: BrowserAct kết hợp thực thi trình duyệt thực tế, trích xuất có cấu trúc, quản lý phiên, lập lịch, tùy chọn proxy và khả năng chuyển giao cho con người.
Sự khác biệt quan trọng là BrowserAct có hai mô hình hoạt động. BrowserAct Cloud cho phép người dùng mô tả mục tiêu và xây dựng Bot có thể tái sử dụng. Kho lưu trữ BrowserAct Skills cung cấp CLI Agent được cấp giấy phép MIT và Skill mà các agent AI địa phương có thể gọi từ các công cụ như Claude Code, Cursor, Codex, Gemini CLI và OpenClaw.
Sự phân chia này khiến BrowserAct phù hợp với hai đối tượng. Các nhóm vận hành có thể sử dụng giao diện được quản lý mà không cần duy trì cơ sở hạ tầng trình duyệt, trong khi các nhà phát triển có thể đặt kiểm soát trình duyệt bên trong quy trình agent hiện có.
Các tính năng chính của BrowserAct tập trung vào các vấn đề vận hành xuất hiện khi một demo tự động hóa trình duyệt trở thành quy trình lặp lại.
BrowserAct Cloud chấp nhận mô tả về trang web, bộ lọc và các trường mà người dùng cần. Dịch vụ khám phá trang web, xây dựng Bot có thể tái sử dụng và trả về dữ liệu có cấu trúc hoặc tệp nguồn. Các Bot có thể được chạy lại, phiên bản hóa, lập lịch và cải thiện khi trang web thay đổi.
Sản phẩm được lưu trữ cũng hỗ trợ giao hàng CSV và JSON, API, webhooks và kết nối với các nền tảng tự động hóa như n8n, Make và Zapier. Đây là cách tiếp cận dễ tiếp cận nhất cho các nhóm muốn đầu ra thay vì khung khung kiểm soát trình duyệt.
CLI BrowserAct địa phương phơi bày trạng thái trình duyệt thông qua văn bản được chỉ mục. Một agent có thể yêu cầu state, sau đó sử dụng các hướng dẫn ngắn gọn như click 3 hoặc input 2 "value" thay vì phân tích liên tục biểu diễn toàn bộ trang. Theo tài liệu chính thức của BrowserAct, môi trường chạy bao gồm trình duyệt, phiên, hồ sơ, ghi nhận mạng và dữ liệu HAR.
Skill đi kèm cũng có khả năng phiên bản. Gọi mẫu của nó hướng dẫn agent tải hướng dẫn chạy với browser-act get-skills core --skill-version 2.0.2, do đó hướng dẫn vận hành có thể phù hợp với phiên bản được cài đặt thay vì dựa vào các hướng dẫn tĩnh được sao chép từ nhiều tháng trước.
BrowserAct tài liệu về việc tái sử dụng Chrome địa phương, phiên sạch hướng đến quyền riêng tư và phiên có danh tính cố định. Các chế độ này đáp ứng các yêu cầu khác nhau: tái sử dụng đăng nhập hiện có, bắt đầu với trạng thái sạch hoặc duy trì danh tính trình duyệt nhất quán cho quy trình tài khoản được ủy quyền.
Các phiên được đặt tên và hồ sơ trình duyệt riêng biệt giảm thiểu rò rỉ trạng thái không mong muốn giữa các nhiệm vụ song song. Điều này quan trọng khi nhiều agent chạy cùng lúc, vì cookie, tab hoặc quyền sở hữu trình duyệt chung có thể tạo ra các lỗi không xác định.
Remote Assist cho phép con người tiếp quản trình duyệt đang chạy khi quy trình đạt đến bước cần phán đoán hoặc hoàn thành thủ công. Agent có thể tiếp tục sau khi con người hoàn thành.
Skill được công bố của BrowserAct cũng xác định các rào cản xác nhận cho các thao tác nhạy cảm. Việc tạo trình duyệt, nhập hồ sơ, thay đổi proxy, đăng nhập, gửi biểu mẫu và tải lên tệp có thể yêu cầu phê duyệt rõ ràng. Thiết kế này hữu ích, mặc dù các nhóm vẫn nên thực hiện các chính sách kiểm soát truy cập, ghi nhật ký và quản lý mật khẩu quanh môi trường chạy.
Sản phẩm Cloud quản lý trình duyệt, lập lịch, dung lượng, tùy chọn proxy và các gián đoạn thông thường. BrowserAct cũng quảng bá khả năng phục hồi khi đường dẫn trang thay đổi và danh tính trình duyệt ổn định cho các quy trình đăng nhập.
Những tính năng này giảm bớt công việc cơ sở hạ tầng, nhưng không làm cho quy trình không cần bảo trì. Các trang web, quyền truy cập, lựa chọn, quy tắc kinh doanh và hệ thống xác thực vẫn có thể thay đổi. Các nhóm sản xuất cần các khẳng định, lịch sử chạy, thử lại có giới hạn và thông báo cho đầu ra không hoàn tất.
BrowserAct sử dụng mô hình miễn phí và tín dụng thay vì giá theo người dùng. README chính thức trên GitHub nói rằng tự động hóa Chrome cơ bản có thể chạy mà không cần đăng ký, trong khi người dùng đã đăng ký nhận quyền truy cập vào các khả năng địa phương bổ sung và tối đa năm trình duyệt ẩn danh. Các dịch vụ proxy được quản lý và trình duyệt ẩn danh bổ sung là các dịch vụ có phí.
Trang giá của BrowserAct hiện liệt kê các ví dụ sử dụng sau:
| Thành phần | Giá sử dụng đã công bố | Điều gì được bao gồm |
|---|---|---|
| Bước quy trình | 5 tín dụng mỗi bước, công bố từ 0,0032 USD | Thực thi tác vụ AI và lập lịch trình duyệt từ xa |
| Trình duyệt dấu vân tay địa phương | 100 tín dụng, công bố từ 0,064 USD mỗi trình duyệt | Một hồ sơ tách biệt với gán proxy |
| Proxy động | 5.000 tín dụng mỗi GB, công bố từ 3,20 USD mỗi GB | Giao thông proxy được quay hoặc cố định theo quốc gia |
| Trình duyệt Cloud | Miễn phí trong thời gian giới hạn | Thực thi trình duyệt nền được lưu trữ |
Trang giá cả thay đổi, và giá đơn vị thấp nhất có thể phụ thuộc vào gói tín dụng. Một đánh giá thực tế nên lặp lại các nhiệm vụ đại diện và ghi lại các bước, hồ sơ trình duyệt, băng thông proxy, thử lại và tần suất chạy được lập lịch.
BrowserAct nên được đánh giá dựa trên chất lượng hoàn thành và chi phí bảo trì, chứ không phải dựa trên tuyên bố tốc độ hoặc tỷ lệ thành công duy nhất. Nền tảng chạy các quy trình trình duyệt đầy đủ, do đó hiệu suất phụ thuộc vào độ phức tạp trang, địa lý mạng, quyết định mô hình, xác thực và số lượng tương tác yêu cầu.
Sản phẩm Cloud hấp dẫn về mặt vận hành khi nhóm muốn xây dựng một lần và chạy cùng nhiệm vụ dữ liệu công khai nhiều lần. CLI Agent linh hoạt hơn khi agent AI cần kiểm tra trạng thái và quyết định hành động tiếp theo trong quy trình dài hơn.
Đối với kiểm thử sản xuất, đo ít nhất năm yếu tố: tỷ lệ hoàn thành nhiệm vụ, độ đầy đủ của cấu trúc, thời gian chạy trung vị, tín dụng tiêu thụ mỗi lần chạy thành công và tỷ lệ chạy cần can thiệp của con người. Các bài kiểm tra nên bao gồm thay đổi trang và trạng thái thất bại, không chỉ đường đi thuận lợi.
BrowserAct có một số ưu điểm thực tế:
BrowserAct cũng đưa ra các lựa chọn thay thế mà người mua nên hiểu.
Đầu tiên, diện tích sản phẩm rộng. Các Bots Cloud, CLI Agent, Skills, Skill Forge, hồ sơ trình duyệt, bước quy trình và tín dụng proxy tạo ra nhiều khái niệm để học hơn so với một API thu thập dữ liệu tập trung. Các nhóm nên quyết định mô hình hoạt động họ cần trước khi so sánh tính năng.
Thứ hai, việc điều khiển trình duyệt do AI hướng dẫn có thể ít dự đoán hơn so với mã xác định. Việc diễn giải ngôn ngữ tự nhiên giúp khi trang web thay đổi, nhưng các hành động quan trọng vẫn cần kiểm tra và điều kiện dừng rõ ràng.
Thứ ba, dự báo chi phí yêu cầu kiểm tra khối lượng công việc. Việc tiêu thụ tín dụng có thể bao gồm bước quy trình, hồ sơ trình duyệt và lưu lượng proxy, do đó giá đơn vị thấp không trực tiếp tiết lộ chi phí của một nhiệm vụ kinh doanh hoàn tất.
Cuối cùng, một công cụ phát triển nhanh yêu cầu kỷ luật phiên bản. Kho lưu trữ GitHub cho thấy hơn 5.000 ngôi sao tại thời điểm đánh giá này, nhưng sự phổ biến không thay thế cho đánh giá bảo mật, kiểm tra hồi quy hoặc đánh giá hỗ trợ. Khóa các phiên bản CLI và Skill được sử dụng trong sản xuất và xem xét các thay đổi phiên bản trước khi triển khai.
Lựa chọn thay thế tốt nhất cho BrowserAct phụ thuộc vào việc bạn muốn công cụ sở hữu bao nhiêu cơ sở hạ tầng và quyết định.
| Tùy chọn | Phù hợp hơn khi | Lựa chọn thay đổi chính |
|---|---|---|
| Playwright | Quy trình xác định và nhóm muốn kiểm soát trình duyệt ở cấp độ mã | Nhiều cơ sở hạ tầng trình duyệt và bảo trì vẫn nằm trong nhóm của bạn |
| Browser Use | Các nhà phát triển Python muốn một khung khung agent mã nguồn mở tập trung vào nhiệm vụ trình duyệt dựa trên mô hình | Bạn xây dựng nhiều phần của cấu trúc sản xuất xung quanh |
| Browserbase | Các nhóm muốn phiên trình duyệt được quản lý và API nhà phát triển như các thành phần cơ sở hạ tầng | Hành vi agent và thiết kế quy trình vẫn là các vấn đề riêng |
| Firecrawl | Yêu cầu chính là trích xuất nội dung web thay vì các phiên tương tác dài | Nó ít tập trung vào việc vận hành các quy trình trình duyệt phức tạp |
| BrowserAct | Bạn muốn Bots được quản lý hoặc CLI có sẵn cho agent với các tính năng tách biệt phiên, danh tính, chuyển giao và trích xuất cùng nhau | Nền tảng rộng và mô hình tín dụng yêu cầu đánh giá |
BrowserAct không tự động là sự thay thế tốt nhất cho mọi công cụ thu thập dữ liệu hoặc bộ kiểm tra. Nếu API có thể cung cấp dữ liệu cần thiết một cách đáng tin cậy, nó thường sẽ đơn giản hơn so với tự động hóa trình duyệt. Nếu một quy trình cần các khẳng định chính xác và kiểm tra UI lặp lại, Playwright có thể cung cấp kiểm soát rõ ràng hơn. BrowserAct trở nên hấp dẫn hơn khi việc điều hướng, trạng thái trang thay đổi, tách biệt phiên và quyết định agent trở thành trung tâm.
BrowserAct là ứng cử viên hợp lý cho bốn nhóm:
BrowserAct ít hấp dẫn hơn cho một cuộc gọi API một lần, một công cụ thu thập dữ liệu nhỏ hoặc một bộ kiểm tra nơi mỗi bước trình duyệt phải duy trì hoàn toàn xác định. Nó cũng không nên được sử dụng để truy cập dữ liệu riêng tư hoặc bị hạn chế mà không có sự cho phép. Khả năng kỹ thuật không tạo ra quyền hạn; các nhóm vẫn chịu trách nhiệm về điều khoản trang web, yêu cầu bảo mật, giảm thiểu dữ liệu và xử lý an toàn thông tin đăng nhập.
BrowserAct là nền tảng tự động hóa trình duyệt đầy tham vọng kết nối việc xây dựng Bots không mã hóa với môi trường chạy địa phương hướng đến agent. Ý tưởng mạnh nhất của nó không phải là bất kỳ lệnh nào duy nhất. Đó là nỗ lực đóng gói thực thi trình duyệt, trạng thái tái sử dụng, tách biệt song song, đầu ra có cấu trúc, chuyển giao cho con người và cơ sở hạ tầng được quản lý thành lớp vận hành nhất quán.
Sản phẩm Cloud dễ tiếp cận hơn, trong khi CLI Agent cung cấp kiến trúc phân biệt hơn cho các nhóm kỹ thuật. BrowserAct xứng đáng được thử nghiệm khi quy trình đã vượt quá một công cụ thu thập dữ liệu cơ bản nhưng không đáng để xây dựng mọi thành phần trình duyệt, phiên và khôi phục nội bộ. Chạy một khái niệm chứng minh đại diện trước khi cam kết, và đo lường đầu ra đã hoàn thành thay vì thành công trong demo.
Nếu một quy trình BrowserAct được ủy quyền cần đường dẫn xử lý CAPTCHA bên ngoài, xem hướng dẫn thực tế để kết nối BrowserAct với CapSolver. Bài viết tích hợp được cố ý tách biệt khỏi đánh giá này và tập trung vào chi tiết triển khai.
Câu hỏi: BrowserAct có phải là mã nguồn mở không?
Kho lưu trữ Skills của BrowserAct là mã nguồn mở dưới giấy phép MIT, nhưng BrowserAct Cloud và cơ sở hạ tầng được quản lý của nó là các dịch vụ thương mại được lưu trữ. Xem xét riêng biệt các kho lưu trữ và điều khoản dịch vụ khi đánh giá yêu cầu triển khai.
Câu hỏi: BrowserAct là công cụ thu thập dữ liệu không mã hóa hay công cụ agent AI?
BrowserAct là cả hai: BrowserAct Cloud cung cấp Bots thu thập dữ liệu dựa trên hướng dẫn, trong khi CLI Agent cung cấp lệnh trình duyệt trực tiếp và kiểm soát phiên cho agent AI. Chọn hướng sản phẩm dựa trên ai sẽ vận hành quy trình và nơi nó phải chạy.
Câu hỏi: BrowserAct có giá bao nhiêu?
BrowserAct kết hợp khả năng địa phương miễn phí với các bước quy trình, hồ sơ trình duyệt và proxy được quản lý dựa trên tín dụng. Vì tổng chi phí phụ thuộc vào nhiệm vụ, hãy kiểm tra một quy trình đại diện và tính toán chi phí mỗi kết quả thành công thay vì chỉ so sánh các giá đơn vị đã công bố.
Câu hỏi: BrowserAct có hoạt động với Claude Code, Cursor và Codex không?
Có. BrowserAct liệt kê Claude Code, Cursor, Codex, Gemini CLI, OpenClaw, OpenCode và VS Code trong số các môi trường agent tương thích, miễn là agent có thể tải Skills và thực thi CLI BrowserAct.
Câu hỏi: BrowserAct tốt hơn Playwright không?
BrowserAct phù hợp hơn với các quy trình được điều khiển bởi agent và các hoạt động trình duyệt được quản lý, trong khi Playwright thường tốt hơn cho tự động hóa và kiểm tra dựa trên mã xác định. Lựa chọn đúng phụ thuộc vào việc quyết định thích ứng hay kiểm soát theo kịch bản chính xác quan trọng hơn.
Câu hỏi: BrowserAct có thể chạy nhiều nhiệm vụ trình duyệt cùng lúc không?
Có. BrowserAct tài liệu về các trình duyệt độc lập, phiên được đặt tên, hồ sơ tách biệt và hoạt động đa phiên trong cùng trình duyệt. Các nhóm sản xuất vẫn nên thiết lập quyền sở hữu rõ ràng, giới hạn đồng thời và kiểm tra xác minh cho mỗi nhiệm vụ song song.
TL;DR - Lỗi hết thời gian CAPTCHA của trợ lý AI cần có ngân sách riêng cho sự sẵn sàng trang, vận chuyển công cụ, xử lý CAPTCHA và xác nhận ứng dụng. - Kết quả muộn phải bị loại bỏ khi URL trang, ngữ cảnh trình duyệt, thách thức hoặc hành động được ủy quyền đã thay đổi. - Một lần thử lại có giới hạn có thể hợp lý cho lỗi vận chuyển tạm thời, nhưng các điểm kiểm tra lặp lại nên mở con đường xem xét lại. - Điều kiện vượt qua cuối cùng là trạng thái ứng dụng ban đầu, chứ không phải sự vắng mặt của ngoại lệ được ném ra. Giới thiệu

Một trình giải reCAPTCHA mcp rất hữu ích khi một nhiệm vụ AI được phép đã biết reCAPTCHA mà nó gặp phải và cần một cuộc gọi phục hồi có cấu trúc. CapSolver cung cấp công cụ `solve_captcha` chính thức thông qua `capsolver-mcp`, trong khi `detect_captchas` và `solve_on_page` hỗ trợ phục hồi được điều khiển bởi trình duyệt. Tích hợp nên giữ nguyên URL trang, phiên bản reCAPTCHA, khóa trang, phiên bản trình duyệt và hành động được ủy quyền như một điểm kiểm tra. Nó cũng nên dừng lại thay vì đoán whe
