
Rajinder Singh
Deep Learning Researcher

state, click और input के माध्यम से काम करता है, जबकि क्लाउड उत्पाद गैर-विकासकों के लिए आसान है।BrowserAct एक AI-मुख्य ब्राउज़र ऑटोमेशन प्लेटफॉर्म है जो ब्राउज़र कार्य को पुनर्प्रयोज्य वर्कफ़्लो या एजेंट-कॉल करने योग्य आदेश में बदलने के लिए डिज़ाइन किया गया है। इसका उत्पाद बिना कोड के स्क्रैपर से अधिक है: BrowserAct वास्तविक ब्राउज़र निष्पादन, संरचित निकालना, सत्र प्रबंधन, योजना, प्रॉक्सी विकल्प और मानव अंतरण को एक साथ जोड़ता है।
महत्वपूर्ण अंतर यह है कि BrowserAct के दो संचालन मॉडल हैं। BrowserAct Cloud एक उपयोगकर्ता को लक्ष्य बताने की अनुमति देता है और एक पुनर्प्रयोज्य होस्टेड बॉट बनाता है। BrowserAct Skills रिपॉजिटरी एमआईटी-लाइसेंसित एजेंट CLI और कौशल प्रदान करता है जो स्थानीय AI एजेंट को क्लॉउड कोड, कर्नर, कोडेक्स, जेमिनी क्लाइंट, ओपनक्लॉव आदि जैसे उपकरणों से कॉल कर सकते हैं।
इस विभाजन के कारण BrowserAct दो वर्गों के लिए संबंधित है। ऑपरेशन टीमें ब्राउज़र इंफ्रास्ट्रक्चर बनाए रखे बिना एक प्रबंधित इंटरफ़ेस का उपयोग कर सकती हैं, जबकि विकासकर्ता अपने मौजूदा एजेंट वर्कफ़्लो में ब्राउज़र नियंत्रण रख सकते हैं।
BrowserAct की मुख्य विशेषताएं ब्राउज़र ऑटोमेशन डेमो के बाद उत्पन्न होने वाली ऑपरेशनल समस्याओं पर केंद्रित हैं।
BrowserAct Cloud वेबसाइट, फ़िल्टर और उपयोगकर्ता की आवश्यकताओं के बारे में वर्णन स्वीकार करता है। सेवा साइट का अन्वेषण करती है, एक पुनर्प्रयोज्य बॉट बनाती है और संरचित डेटा या स्रोत फ़ाइलें वापस करती है। बॉट्स को दोहराया जा सकता है, संस्करण बनाया जा सकता है, योजना बनाया जा सकता है और जब वेबसाइट बदल जाती है तो सुधार किया जा सकता है।
होस्टेड उत्पाद के साथ CSV और JSON डिलीवरी, एपीआई, वेबहुक और नैन, मेक, ज़ैपियर जैसे ऑटोमेशन प्लेटफॉर्म के साथ जुड़ना भी समर्थित है। यह टीमों के लिए सबसे सुलभ BrowserAct रास्ता है जो आउटपुट के बजाय ब्राउज़र-नियंत्रण फ्रेमवर्क के लिए है।
स्थानीय BrowserAct CLI अनुक्रमित पाठ के माध्यम से ब्राउज़र स्थिति को उपलब्ध कराता है। एजेंट को state के अनुरोध कर सकता है, फिर पूरे पृष्ठ प्रतिनिधित्व के बजाय संक्षिप्त निर्देशों जैसे click 3 या input 2 "value" का उपयोग कर सकता है। आधिकारिक BrowserAct डॉक्यूमेंटेशन के अनुसार, रनटाइम में ब्राउज़र, सत्र, प्रोफाइल, नेटवर्क कैप्चर और HAR डेटा शामिल हैं।
साथ ही कौशल भी संस्करण-जानकार है। इसका खोज बूस्टर एजेंट को browser-act get-skills core --skill-version 2.0.2 के साथ रनटाइम निर्देश लोड करने के लिए कहता है, ताकि संचालन गाइडेंस इंस्टॉल्ड रिलीज के साथ मेल खाए बजाय कई महीनों पहले कॉपी किए गए स्थिर प्रॉम्प्ट पर निर्भर न हो।
BrowserAct स्थानीय क्रोम पुनर्उपयोग, ताजा गोपनीयता-मुख्य सत्र और निश्चित-पहचान सत्र दर्ज करता है। इन मोड के अलग-अलग आवश्यकताएं हैं: मौजूदा लॉगिन का पुनर्उपयोग, साफ स्थिति के साथ शुरू करना, या अधिकृत खाता वर्कफ़्लो के लिए एक निश्चित ब्राउज़र पहचान बनाए रखना।
नामित सत्र और अलग ब्राउज़र प्रोफाइल समानांतर कार्यों के बीच अकारण स्थिति रिसाव को कम करते हैं। यह तब महत्वपूर्ण होता है जब कई एजेंट एक साथ चल रहे होते हैं, क्योंकि साझा कुकीज, टैब या ब्राउज़र स्वामित्व अनिश्चित विफलताओं का कारण बन सकते हैं।
रिमोट असिस्ट एक जब वर्कफ़्लो एक चरण तक पहुंचता है जिसमें निर्णय या हस्ताक्षर की आवश्यकता होती है, तो एक मानव को एक जीवंत ब्राउज़र ले लेता है। एजेंट एक मानव द्वारा अंतिम कार्य पूरा करने के बाद जारी रख सकता है।
BrowserAct के प्रकाशित कौशल भी संवेदनशील कार्यों के लिए पुष्टि गेट्स परिभाषित करता है। ब्राउज़र बनाना, प्रोफाइल आयात, प्रॉक्सी बदलाव, लॉगिन, फॉर्म जमा और फ़ाइल अपलोड करना विवेकपूर्ण मंजूरी की आवश्यकता हो सकती है। इस डिज़ाइन उपयोगी है, फिर भी टीमों को अपने आप ही एक्सेस नियंत्रण, लॉगिंग और पहचान प्रमाण पत्र नीतियों के आसपास बल देना चाहिए।
क्लाउड उत्पाद ब्राउज़र, योजना, क्षमता, प्रॉक्सी विकल्प और सामान्य सत्यापन अवरोधों के प्रबंधन करता है। BrowserAct यह भी घोषित करता है कि पृष्ठ मार्ग बदल जाने पर बरकरार रखा जा सकता है और लॉगइन वर्कफ़्लो के लिए स्थायी ब्राउज़र पहचान।
इन विशेषताओं के कारण बुनियादी ढांचा काम कम हो जाता है, लेकिन एक वर्कफ़्लो रखरखाव मुक्त नहीं बनाता। वेबसाइट, अनुमति, सेलेक्टर, व्यावसायिक नियम और पहचान प्रणालियां अभी भी बदल सकती हैं। उत्पादन टीमों को आश्वासन, चलाने के इतिहास, सीमित पुनर्प्रयास और अपूर्ण आउटपुट के लिए चेतावनी की आवश्यकता होती है।
BrowserAct एक एकल-सीट मूल्य के बजाय एक हाइब्रिड मुफ्त और क्रेडिट मॉडल का उपयोग करता है। आधिकारिक गिटहब README कहता है कि बुनियादी क्रोम ऑटोमेशन रजिस्टर किए बिना चल सकता है, जबकि पंजीकृत उपयोगकर्ताओं को अतिरिक्त स्थानीय क्षमताओं और अधिकतम पांच स्टील्थ ब्राउज़र की पहुंच मिलती है। प्रबंधित प्रॉक्सी और अतिरिक्त स्टील्थ ब्राउज़र भुगतान सेवाएं हैं।
BrowserAct मूल्य निर्धारण पृष्ठ वर्तमान में इन उपयोग उदाहरणों की सूची देता है:
| घटक | प्रकाशित उपयोग मूल्य | क्या इसकी कवरेज है |
|---|---|---|
| वर्कफ़्लो चरण | प्रति चरण 5 क्रेडिट, $0.0032 से शुरू | AI कार्य निष्पादन और दूरस्थ ब्राउज़र योजना |
| स्थानीय फिंगरप्रिंट ब्राउज़र | 100 क्रेडिट, $0.064 प्रति ब्राउज़र से शुरू | अलगाव वाला प्रोफाइल और प्रॉक्सी नियुक्ति |
| डायनामिक प्रॉक्सी | 5,000 क्रेडिट प्रति जीबी, $3.20 प्रति जीबी से शुरू | देश-लक्षित घूमता या स्थिर प्रॉक्सी ट्रैफिक |
| क्लाउड ब्राउज़र | सीमित समय के लिए मुफ्त | होस्टेड पृष्ठभूमि ब्राउज़र निष्पादन |
मूल्य निर्धारण पृष्ठ बदल सकते हैं, और सबसे कम घोषित इकाई लागत एक क्रेडिट पैकेज पर निर्भर कर सकती है। एक वास्तविक मूल्यांकन अनुकूलित कार्यों को दोहराए और चरणों, ब्राउज़र प्रोफाइल, प्रॉक्सी बैंडविड्थ, पुनर्प्रयास और योजना-चलाने की आवृत्ति के बारे में रिकॉर्ड करे।
BrowserAct की बेहतर मूल्यांकन उपलब्धि और रखरखाव लागत द्वारा किया जाना चाहिए, एक एकल गति या सफलता दर के दावे के बजाय। प्लेटफॉर्म पूर्ण ब्राउज़र वर्कफ़्लो चलाता है, इसलिए प्रदर्शन पृष्ठ की जटिलता, नेटवर्क भूगोल, मॉडल निर्णय, पहचान, और आवश्यक अंतःक्रिया की संख्या पर निर्भर करता है।
क्लाउड उत्पाद जब एक टीम एक बार बनाना चाहती है और एक ही सार्वजनिक-डेटा कार्य दोहराना चाहती है, तो ऑपरेशनल आकर्षक है। एजेंट CLI जब एक AI एजेंट को लंबे वर्कफ़्लो में स्थिति की जांच करने और अगली कार्यवाही का निर्णय लेने की आवश्यकता होती है, तो अधिक लचीला है।
उत्पादन परीक्षण के लिए, कम से कम पांच चीजों को मापें: कार्य पूर्णता दर, स्कीमा पूर्णता, माध्य चलाने का समय, सफल चलाने पर लिए गए क्रेडिट, और आवश्यक मानव हस्तांतरण के आवश्यकता वाले चलाने का प्रतिशत। परीक्षणों में पृष्ठ बदलाव और असफल अवस्था शामिल होनी चाहिए, न कि केवल खुश रास्ता।
BrowserAct कई व्यावहारिक मजबूती हैं:
BrowserAct भी खरीदारों के लिए व्यापार बल्कि लाएगा।
पहला, उत्पाद सतह व्यापक है। क्लाउड बॉट्स, एजेंट CLI, कौशल, कौशल फोर्ज, ब्राउज़र प्रोफाइल, वर्कफ़्लो चरण और प्रॉक्सी क्रेडिट एक ध्यान के बजाय एक ध्यान के बजाय अधिक अवधारणाओं के लिए शुरू करते हैं। टीमों को विशेषताओं की तुलना करने से पहले किस संचालन मॉडल की आवश्यकता है यह निर्धारित करना चाहिए।
दूसरा, AI-निर्देशित ब्राउज़र निष्पादन निश्चित कोड के मुकाबले कम भविष्यवाणी योग्य हो सकता है। प्राकृतिक-भाषा अर्थात्मकता जब पृष्ठ भिन्न होते हैं, तो मदद करता है, लेकिन महत्वपूर्ण कार्यों की पुष्टि और स्पष्ट रोक स्थितियां अभी भी आवश्यक हैं।
तीसरा, लागत अनुमान वर्कलोड परीक्षण के आवश्यकता है। क्रेडिट उपभोग वर्कफ़्लो चरण, ब्राउज़र प्रोफाइल और प्रॉक्सी ट्रैफिक के आसपास हो सकता है, इसलिए निम्न इकाई मूल्य एक पूर्ण व्यावसायिक कार्य के लिए लागत के बारे में सीधे जानकारी नहीं देता।
अंत में, एक तेजी से बदलता उपकरण संस्करण विवेक की आवश्यकता है। गिटहब रिपॉजिटरी के समय इस समीक्षा में 5,000 स्टार थे, लेकिन लोकप्रियता सुरक्षा समीक्षा, रिग्रेशन परीक्षण या समर्थन मूल्यांकन के स्थान नहीं ले सकती। उत्पादन में उपयोग किए गए CLI और कौशल संस्करणों को निर्धारित करें और डेप्लॉयमेंट से पहले रिलीज बदलावों की समीक्षा करें।
बेहतर ब्राउज़र एक्ट विकल्प आपके द्वारा उपकरण के द्वारा कितना बुनियादी ढांचा और निर्णय लेने के लिए अपनाया जाना चाहिए।
| विकल्प | बेहतर फिट जब | मुख्य व्यापार बल्कि |
|---|---|---|
| प्लेयराइट | वर्कफ़्लो निश्चित है और टीम को कोड-स्तर ब्राउज़र नियंत्रण चाहिए | अधिक ब्राउज़र बुनियादी ढांचा और रखरखाव अपने टीम के साथ रहता है |
| ब्राउज़र उपयोग | पायथन विकासकर्ता एक मॉडल-चालित ब्राउज़र कार्यों पर केंद्रित ओपन-सोर्स एजेंट फ्रेमवर्क चाहते हैं | आप अधिक बाहरी उत्पादन स्टैक जोड़ते हैं |
| ब्राउज़रबेस | टीम ब्राउज़र सत्रों और डेवेलपर एपीआई के रूप में बुनियादी ढांचा आवश्यकताओं के साथ प्रबंधित सत्र चाहते हैं | एजेंट व्यवहार और वर्कफ़्लो डिज़ाइन अलग विचार हैं |
| फायरक्रैल | मुख्य आवश्यकता वेब सामग्री निकालना है बजाय लंबे अंतःक्रिया सत्रों के | यह जटिल ब्राउज़र वर्कफ़्लो के चलाने पर कम ध्यान केंद्रित करता है |
| ब्राउज़रएक्ट | आप प्रबंधित बॉट्स या एजेंट-तैयार CLI के साथ सत्र, पहचान, हस्तांतरण और निकालना विशेषताओं के साथ एक साथ चाहते हैं | व्यापक प्लेटफॉर्म और क्रेडिट मॉडल के मूल्यांकन की आवश्यकता है |
BrowserAct हर स्क्रैपर या टेस्ट सेट के लिए स्वचालित रूप से सबसे अच्छा विकल्प नहीं है। यदि आवश्यक डेटा विश्वसनीय रूप से उपलब्ध कराता है, तो यह ब्राउज़र ऑटोमेशन के मुकाबले आमतौर पर सरल होगा। यदि एक वर्कफ़्लो को सटीक आश्वासन और दोहराए जा सकने वाले यूआई परीक्षण की आवश्यकता होती है, तो Playwright अधिक स्पष्ट नियंत्रण प्रदान कर सकता है। BrowserAct जब नेविगेशन, बदलती पृष्ठ स्थिति, सत्र अलगाव और एजेंट निर्णय केंद्रीय होते हैं, तो अधिक आकर्षक होता है।
BrowserAct चार समूहों के लिए एक उपयुक्त छोटी सूची के उम्मीदवार है:
BrowserAct एक बार के API कॉल, छोटा स्थिर स्क्रैपर या एक टेस्ट सेट के लिए कम आकर्षक है जहां प्रत्येक ब्राउज़र चरण पूरी तरह से निश्चित होना चाहिए। इसका उपयोग अनधिकृत डेटा तक पहुंचने के लिए नहीं किया जाना चाहिए। तकनीकी क्षमता अनुमति नहीं बनाती है; टीमें साइट की शर्तों, गोपनीयता की आवश्यकताओं, डेटा के न्यूनतम के लिए जिम्मेदार रहती हैं और पहचान प्रमाण के सुरक्षित निपटान के लिए।
BrowserAct एक उत्साहजनक ब्राउज़र ऑटोमेशन प्लेटफॉर्म है जो बिना कोड बॉट बिल्डिंग के साथ एजेंट-मुख्य स्थानीय रनटाइम को जोड़ता है। इसकी सबसे मजबूत विचार एक एकल आदेश नहीं है। यह ब्राउज़र निष्पादन, पुनर्प्रयोज्य स्थिति, समानांतर अलगाव, संरचित आउटपुट, मानव हस्तांतरण और प्रबंधित बुनियादी ढांचा के एक संगठित संचालन लेयर में एक साथ ले जाने की कोशिश है।
क्लाउड उत्पाद आसानी से अपनाया जा सकता है, जबकि एजेंट CLI तकनीकी टीमों के लिए अधिक अलग-अलग आर्किटेक्चर प्रदान करता है। जब एक वर्कफ़्लो एक बुनियादी स्क्रैपर के बाद बढ़ गया है लेकिन आंतरिक रूप से प्रत्येक ब्राउज़र, सत्र और बरकरार घटक बनाने के लिए बजट नहीं है, तो BrowserAct का परीक्षण करना चाहिए। एक प्रतिनिधि प्रूफ ऑफ कॉन्सेप्ट चलाएं बिना निर्णय लें, और पूर्ण आउटपुट के बजाय डेमो सफलता के मापदंड के बजाय मापें।
यदि एक अनुमोदित BrowserAct वर्कफ़्लो के लिए बाहरी CAPTCHA हैंडलिंग पथ की आवश्यकता है, तो BrowserAct के साथ CapSolver के एकीकरण के व्यावहारिक गाइड देखें। एकीकरण लेख इस समीक्षा से अलग है और इम्प्लीमेंटेशन विवरण पर केंद्रित है।
प्रश्न: क्या BrowserAct ओपन सोर्स है?
BrowserAct के एजेंट कौशल रिपॉजिटरी एमआईटी लाइसेंस के साथ ओपन सोर्स है, लेकिन BrowserAct क्लाउड और इसके प्रबंधित बुनियादी ढांचा होस्टेड वाणिज्यिक सेवाएं हैं। डेप्लॉयमेंट आवश्यकताओं के मूल्यांकन के दौरान रिपॉजिटरी और सेवा शर्तों का अलग-अलग अध्ययन करें।
प्रश्न: क्या BrowserAct एक बिना कोड वेब स्क्रैपर या एआई एजेंट टूल है?
BrowserAct दोनों है: BrowserAct क्लाउड एक प्रेरित पुनर्प्रयोज्य स्क्रैपिंग बॉट प्रदान करता है, जबकि एजेंट CLI AI एजेंट को सीधे ब्राउज़र कमांड और सत्र नियंत्रण प्रदान करता है। उपयोगकर्ता द्वारा वर्कफ़्लो चलाने और जहां चलाना होगा, उसके आधार पर उत्पाद मार्ग चुनें।
प्रश्न: BrowserAct कितना महंगा है?
BrowserAct मुफ्त स्थानीय क्षमताओं के साथ क्रेडिट-आधारित वर्कफ़्लो चरण, ब्राउज़र प्रोफाइल और प्रबंधित प्रॉक्सी के साथ मिश्रित है। कुल लागत कार्य पर निर्भर करती है, इसलिए एक प्रतिनिधि वर्कफ़्लो का परीक्षण करें और सफल परिणाम के लिए लागत की गणना करें, केवल घोषित इकाई मूल्यों की तुलना करने के बजाय।
प्रश्न: क्या BrowserAct क्लॉउड कोड, कर्नर, कोडेक्स के साथ काम करता है?
हां। BrowserAct क्लॉउड कोड, कर्नर, कोडेक्स, जेमिनी क्लाइंट, ओपनक्लॉव, ओपनकोड और वीएस कोड के साथ संगत एजेंट वातावरणों की सूची देता है, यदि एजेंट कौशल लोड कर सकता है और BrowserAct CLI चला सकता है।
प्रश्न: BrowserAct Playwright से बेहतर क्यों है?
BrowserAct एजेंट-चालित वर्कफ़्लो और प्रबंधित ब्राउज़र संचालन के लिए अधिक उपयुक्त है, जबकि Playwright आमतौर पर निश्चित कोड-पहला ऑटोमेशन और परीक्षण के लिए बेहतर है। सही चयन यह निर्भर करता है कि अनुकूलित निर्णय या सटीक स्क्रिप्टेड नियंत्रण अधिक महत्वपूर्ण है।
प्रश्न: क्या BrowserAct एक साथ कई ब्राउज़र कार्य चला सकता है?
हां। BrowserAct स्वतंत्र ब्राउज़र, नामित सत्र, अलगाव वाले प्रोफाइल और समान ब्राउज़र बहु-सत्र संचालन के बारे में दस्तावेज़ करता है। उत्पादन टीमें हर समानांतर कार्य के लिए स्पष्ट स्वामित्व, संचालन सीमा और सत्यापन जांच के साथ रखना चाहिए।
TL;DR - एक एआई एजेंट कैप्चा समय सीमा समाप्त हो गई त्रुटि के लिए पृष्ठ तैयारी, उपकरण परिवहन, कैप्चा कार्य और एप्लिकेशन पुष्टि के लिए अलग-अलग बजट की आवश्यकता होती है। - यदि पृष्ठ URL, ब्राउजर संदर्भ, चुनौती या अधिकृत कार्रवाई बदल गई है तो देरी से परिणामों को अस्वीकृत कर देना चाहिए। - एक सीमित पुनः प्रयास अस्थायी परिवहन विफलता के लिए तार्किक हो सकता है, लेकिन बार-बार चेकपॉइंट एक समीक्षा मार्ग खोलना चाहिए। - अंतिम पास स्थिति मूल एप्लिकेशन स्थिति है, कभी-कभी फेंके गए अपवाद की अनुपस्थिति नहीं। परिचय

एक mcp reCAPTCHA समाधानकर्ता तब सबसे उपयोगी होता है जब एक अनुमत AI-एजेंट कार्य के पास पहले से ही reCAPTCHA के बारे में पता होता है जिसे उसे सामना करना पड़ा था और एक संरचित बरीकी कॉल की आवश्यकता होती है। CapSolver `capsolver-mcp` के माध्यम से आधिकारिक `solve_captcha` उपकरण को प्रस्तुत करता है, जबकि `detect_captchas` और `solve_on_page` ब्राउज़र-चालित बरीकी के समर्थन करते हैं। एकीकरण को पेज URL, reCAPTCHA संस्करण, साइट कुंजी, ब्राउज़र सत्र और अधिकृत क्रिया के रूप में एक चेकपॉइंट के रूप में संरक्षित करना चाहिए। इसे अनुमान लगाने के बजाय रुक जाना चाहिए।
