
Rajinder Singh
Deep Learning Researcher

AI रिक्रूटिंग एजेंट्स को मुख्य नौकरी बोर्ड्स से संरचित नौकरी सूची डेटा (शीर्षक, आवश्यकताएं, वेतन, कंपनी विवरण) की आवश्यकता होती है ताकि उम्मीदवारों का मिलान कर सकें, बाजार प्रवृत्तियों का विश्लेषण कर सकें और स्रोत प्रक्रियाओं को स्वचालित कर सकें। नौकरी बोर्ड्स जैसे इंडीड, लिंक्डइन और ग्लासडॉर कैप्चा सुरक्षा का उपयोग करते हैं जो कुछ दर्जन अनुरोधों के बाद स्वचालित संग्रह को अवरुद्ध कर देते हैं। इस गाइड में इंडीड, लिंक्डइन और ग्लासडॉर जैसे नौकरी प्लेटफॉर्मों पर लगातार एक्सेस बनाए रखने के लिए कैपसॉल्वर का उपयोग करके एआई रिक्रूटिंग एजेंट्स के लिए एक नौकरी बोर्ड डेटा पाइपलाइन बनाने के बारे में बताया गया है।
AI रिक्रूटिंग एजेंट्स बड़े पैमाने पर नौकरी बोर्ड एक्सेस के कार्य करते हैं: हजारों सूचियों को स्कैन करके उम्मीदवार कौशल के मिलान, उद्योगों के पार वेतन प्रवृत्तियों की निगरानी, विशिष्ट भूमिकाओं के लिए कौन सी कंपनियां भर्ती कर रही हैं, और उभरती हुई कौशल आवश्यकताओं की पहचान। इनमें से प्रत्येक कार्य नौकरी प्लेटफॉर्म पर बॉट डिटेक्शन को ट्रिगर करने वाले अनुरोध आवृत्ति उत्पन्न करता है।
नौकरी बोर्ड अपने डेटा के व्यावसायिक मूल्य के कारण बॉट सुरक्षा में भारी निवेश करते हैं। सूची डेटा, वेतन जानकारी और कंपनी समीक्षाएं सब्सक्रिप्शन आय उत्पन्न करती हैं। श्रम सांख्यिकी विभाग के डेटा दर्शाता है कि अमेरिकी नौकरी बाजार में मासिक रूप से 6 मिलियन नियुक्तियां होती हैं - इन लेन-देन के आधार डेटा रिक्रूटिंग तकनीक कंपनियों के लिए बिलियन डॉलर के मूल्य का होता है।
जब एआई रिक्रूटिंग एजेंट के इंडीड के खोज परिणामों, लिंक्डइन की नौकरी सूचियों या ग्लासडॉर के कंपनी पृष्ठों पर CAPTCHA का सामना करता है, तो उम्मीदवार मिलान और बाजार विश्लेषण के लिए आवश्यक डेटा संग्रह जारी रखने में असमर्थ हो जाता है। कैपसॉल्वर निर्माण डेटा पाइपलाइन को लगातार चलाए रखने के लिए वेरिफिकेशन-क्लीयरिंग लेयर प्रदान करता है।
pip install git+https://github.com/capsolver-ai/capsolver-core.git
pip install aiohttp beautifulsoup4 pandas
export CAPSOLVER_API_KEY="your-capsolver-api-key"
अतिरिक्त आवश्यकताएं:
JOB_BOARDS = {
"indeed": {
"name": "Indeed",
"captcha_type": "ReCaptchaV2TaskProxyLess",
"trigger": "after_30_searches",
"data_fields": ["title", "company", "location", "salary", "description", "posted_date"]
},
"linkedin_jobs": {
"name": "LinkedIn Jobs",
"captcha_type": "AntiTurnstileTaskProxyLess",
"trigger": "rate_limit_and_behavioral",
"data_fields": ["title", "company", "location", "level", "employment_type", "applicants"]
},
"glassdoor": {
"name": "Glassdoor",
"captcha_type": "ReCaptchaV2TaskProxyLess",
"trigger": "after_40_page_views",
"data_fields": ["title", "company", "salary_range", "rating", "reviews", "benefits"]
},
"ziprecruiter": {
"name": "ZipRecruiter",
"captcha_type": "AntiTurnstileTaskProxyLess",
"trigger": "rate_limit_60_per_hour",
"data_fields": ["title", "company", "salary", "location", "skills", "posted_date"]
}
}
प्रत्येक नौकरी बोर्ड पर CAPTCHA पैरामीटर की पहचान करने के लिए CapSolver ब्राउज़र एक्सटेंशन का उपयोग करें।
import asyncio
from capsolver_core import create_capsolver, CaptchaType, CaptchaInfo
class JobBoardCollector:
"""CAPTCHA हैंडलिंग के साथ नौकरी सूची डेटा एकत्र करें।"""
def __init__(self, api_key: str, proxies: list):
self.cap = create_capsolver(api_key=api_key)
self.proxies = proxies
self.proxy_idx = 0
self.stats = {"listings_collected": 0, "captchas_solved": 0}
async def search_jobs(self, query: str, location: str, platform: str = "indeed") -> list:
"""CAPTCHA हैंडलिंग के साथ नौकरी सूचियां खोजें।"""
proxy = self.proxies[self.proxy_idx % len(self.proxies)]
self.proxy_idx += 1
html = await self._fetch_search(platform, query, location, proxy)
if self._is_captcha(html):
token = await self._solve(platform)
html = await self._retry(platform, query, location, proxy, token)
self.stats["captchas_solved"] += 1
listings = self._parse_listings(html)
self.stats["listings_collected"] += len(listings)
return listings
async def _solve(self, platform_key: str) -> str:
"""एक नौकरी बोर्ड के लिए CAPTCHA हल करें।"""
platform = JOB_BOARDS[platform_key]
type_map = {
"ReCaptchaV2TaskProxyLess": CaptchaType.RECAPTCHA_V2,
"AntiTurnstileTaskProxyLess": CaptchaType.CLOUDFLARE
}
info = CaptchaInfo(
type=type_map[platform["captcha_type"]],
website_url=f"https://www.{platform_key.replace('_', '')}.com",
website_key=platform.get("site_key", "")
)
solution = await self.cap.solve(info)
return solution.token
async def collect_salary_data(self, role: str, location: str) -> dict:
"""विशिष्ट भूमिका और स्थान के लिए वेतन डेटा एकत्र करें।"""
results = {}
for platform in ["indeed", "glassdoor", "ziprecruiter"]:
listings = await self.search_jobs(f"{role} salary", location, platform)
salaries = [l.get("salary") for l in listings if l.get("salary")]
if salaries:
results[platform] = {
"min": min(salaries),
"max": max(salaries),
"median": sorted(salaries)[len(salaries)//2],
"sample_size": len(salaries)
}
await asyncio.sleep(5)
return results
async def close(self):
await self.cap.aclose()
CapSolver API दस्तावेज़ीकरण उच्च-आवृत्ति डेटा संग्रह के लिए समाधान समय अनुकूलन को कवर करता है।
class RecruitingIntelligence:
"""AI रिक्रूटिंग एजेंट डेटा लेयर।"""
def __init__(self, collector: JobBoardCollector):
self.collector = collector
async def market_analysis(self, role: str, locations: list) -> dict:
"""विशिष्ट भूमिका के लिए बाजार विश्लेषण करें।"""
analysis = {}
for location in locations:
listings = await self.collector.search_jobs(role, location)
analysis[location] = {
"total_openings": len(listings),
"companies_hiring": list(set(l.get("company") for l in listings if l.get("company"))),
"common_skills": self._extract_skills(listings),
"salary_range": self._salary_range(listings)
}
await asyncio.sleep(5)
return analysis
async def track_hiring_trends(self, companies: list, period_days: int = 30) -> dict:
"""विशिष्ट कंपनियों के लिए नियुक्ति गतिविधि ट्रैक करें।"""
trends = {}
for company in companies:
listings = await self.collector.search_jobs(company, "remote")
trends[company] = {
"active_listings": len(listings),
"roles": [l.get("title") for l in listings[:10]],
"locations": list(set(l.get("location") for l in listings if l.get("location")))
}
await asyncio.sleep(5)
return trends
def _extract_skills(self, listings: list) -> list:
"""नौकरी विवरण से सामान्य कौशल निकालें।"""
# सरलीकृत कौशल निकालना
all_skills = []
for listing in listings:
desc = listing.get("description", "").lower()
common_skills = ["python", "javascript", "sql", "aws", "react", "machine learning", "docker", "kubernetes"]
for skill in common_skills:
if skill in desc:
all_skills.append(skill)
from collections import Counter
return [s for s, _ in Counter(all_skills).most_common(10)]
| निगरानी शामिल करें | दैनिक खोज | मासिक CAPTCHAs | मासिक लागत |
|---|---|---|---|
| 10 भूमिकाएं, 3 स्थान | ~90 | ~270 | $0.54-0.81 |
| 50 भूमिकाएं, 5 स्थान | ~750 | ~2,250 | $4.50-6.75 |
| 200 भूमिकाएं, 10 स्थान | ~6,000 | ~18,000 | $36-54 |
अनुकूलन रणनीतियां:
अपना बोनस कोड दावा करें: CapSolver डैशबोर्ड पर कोड WEBS का उपयोग करें ताकि प्रत्येक भरोसे पर 5% बोनस मिले। एआई रिक्रूटिंग एजेंट्स बनाने वाले एचआर टेक टीमों के लिए आदर्श।
CapSolver के जिम्मेदार उपयोग के लिए एफक्यूएएस अतिरिक्त दिशा-निर्देश प्रदान करता है। CapSolver वेब स्क्रैपिंग दस्तावेज़ीकरण उच्च आवृत्ति संग्रह के लिए बुनियादी ढांचा पैटर्न को कवर करता है। क्लाउडफ़ेयर-सुरक्षित नौकरी बोर्ड्स के लिए, टर्नस्टाइल दस्तावेज़ीकरण विशिष्ट कार्यान्वयन विवरण प्रदान करता है।
AI रिक्रूटिंग एजेंट्स के लिए नौकरी बोर्ड डेटा पाइपलाइन बनाने में प्लेटफॉर्म CAPTCHA प्रणालियों का प्रोफाइलिंग, CapSolver के साथ एसिंक्रोनस हल करना और एकत्रित डेटा पर बुद्धिमता विशेषताएं बनाना शामिल है। रिज़ीडेंशियल प्रॉक्सी, सत्र प्रबंधन और स्वचालित CAPTCHA हल करने के संयोजन बड़े नौकरी प्लेटफॉर्म पर विश्वसनीय डेटा संग्रह की अनुमति देता है।
इस प्रकार के अनुप्रयोग के साथ मानक CAPTCHA प्रणालियों का उपयोग करने वाले प्लेटफॉर्म काम करते हैं: इंडीड, लिंक्डइन जॉब्स, ग्लासडॉर, ज़िपरेक्यूटर, मॉन्स्टर, कैरियरबिल्डर और अधिक क्षेत्रीय नौकरी बोर्ड। प्रत्येक के लिए विशिष्ट CAPTCHA पैरामीटर पहचान की आवश्यकता होती है।
सक्रिय भर्ती के लिए, दैनिक संग्रह 24 घंटे में नए पोस्टिंग को पकड़ता है। बाजार विश्लेषण और प्रवृत्ति ट्रैकिंग के लिए, हफ्ते में 2-3 बार पर्याप्त है। उच्च मांग वाली भूमिकाओं (इंजीनियरिंग, आईएएल/एमएल) के लिए दिन में दो बार निरीक्षण का लाभ होता है।
50 भूमिकाओं के साथ 5 स्थानों के दैनिक जांच के साथ, लगभग 2,250 CAPTCHAs प्रति माह $2-3 प्रति 1,000 समाधान के आधार पर $4.50-6.75 मासिक होता है। कुल बुनियादी ढांचा के लिए प्रॉक्सी लागत जोड़ें, जो $40/माह से कम होती है।
हां। आवश्यकताओं, कौशल और अनुभव स्तर के साथ संरचित नौकरी सूची डेटा के साथ उम्मीदवार प्रोफाइल के मिलान के लिए AI मैचिंग संभव है। मुख्य बात नौकरी विवरण से संरचित कौशल आवश्यकताओं को निकालना है और उनकी तुलना उम्मीदवार की योग्यताओं से करना है।
लिंक्डइन कई मानक CAPTCHA के अलावा अतिरिक्त सुरक्षा परतों का उपयोग करता है। वास्तविक सत्र व्यवहार बनाए रखें, रिज़ीडेंशियल प्रॉक्सी का उपयोग करें और अनुरोध आवृत्ति को 20-30 प्रति घंटा तक सीमित रखें। प्रोफाइल डेटा के बजाय सार्वजनिक रूप से उपलब्ध नौकरी सूचियों पर ध्यान केंद्रित करें और स्वचालित एक्सेस के लिए लिंक्डइन की शर्तों का पालन करें।
Rust में वेब स्क्रैपिंग के स्केलेबल आर्किटेक्चर सीखें, reqwest, scraper, असिंक्रोनस स्क्रैपिंग, हेडलेस ब्राउज़र स्क्रैपिंग, प्रॉक्सी रोटेशन, और संगत CAPTCHA का निपटारा।

CapSolver के साथ RoxyBrowser के एकीकरण करें ताकि ब्राउज़र के कार्यों को स्वचालित किया जा सके और reCAPTCHA, Turnstile और अन्य CAPTCHAs को बायपास किया जा सके।
