
Adélia Cruz
Neural Network Developer

Agentes de IA que realizam devido diligence, enriquecimento de leads e verificações de conformidade precisam de dados estruturados de empresas de registros comerciais governamentais — detalhes de incorporação, nomes de diretores, status de registros e endereços registrados. Esses registros utilizam proteção CAPTCHA que bloqueia fluxos automatizados de verificação. Este guia aborda a construção de uma pipeline de extração de dados de registros comerciais para agentes de IA usando o CapSolver para manter acesso a bancos de dados corporativos estaduais, federais e internacionais.
Registros comerciais são fontes autoritárias para verificação de empresas. Quando um agente de IA precisa confirmar que uma empresa existe, verificar seu status atual, identificar diretores ou verificar seu endereço registrado, ele consulta esses bancos de dados governamentais. O desafio é que praticamente todos os registros comerciais utilizam proteção CAPTCHA para impedir o acesso automatizado em massa.
Isso cria um gargalo para agentes de IA realizando:
SEC EDGAR, bancos de dados do Secretário de Estado estadual, Companies House do Reino Unido e registros comerciais da UE todos implementam desafios de verificação. Sem resolução automatizada, um agente de IA realizando 100 verificações de empresas por dia enfrenta 30-50 intervenções manuais de CAPTCHA — tornando a operação autônoma impossível.
pip install git+https://github.com/capsolver-ai/capsolver-core.git
pip install aiohttp beautifulsoup4 pandas
export CAPSOLVER_API_KEY="sua-chave-da-api-do-capsolver"
Requisitos adicionais:
BUSINESS_REGISTRIES = {
"delaware_sos": {
"name": "Secretário de Estado da Delaware",
"url": "https://icis.corp.delaware.gov",
"captcha_type": "ReCaptchaV2TaskProxyLess",
"data": ["entity_name", "file_number", "status", "formation_date", "agent"]
},
"california_sos": {
"name": "Secretário de Estado da Califórnia",
"url": "https://bizfileonline.sos.ca.gov",
"captcha_type": "ReCaptchaV2TaskProxyLess",
"data": ["entity_name", "number", "status", "type", "jurisdiction", "agent"]
},
"uk_companies_house": {
"name": "Companies House do Reino Unido",
"url": "https://find-and-update.company-information.service.gov.uk",
"captcha_type": "ReCaptchaV2TaskProxyLess",
"data": ["company_name", "number", "status", "type", "incorporated", "officers"]
},
"sec_edgar": {
"name": "SEC EDGAR",
"url": "https://www.sec.gov/cgi-bin/browse-edgar",
"captcha_type": "ImageToTextTask",
"data": ["company_name", "cik", "filings", "sic_code", "state"]
}
}
import asyncio
from capsolver_core import create_capsolver, CaptchaType, CaptchaInfo
class BusinessRegistryExtractor:
"""Extraia dados de empresas de registros governamentais com tratamento de CAPTCHA."""
def __init__(self, api_key: str, proxies: list):
self.cap = create_capsolver(api_key=api_key)
self.proxies = proxies
self.proxy_idx = 0
async def verify_company(self, company_name: str, jurisdiction: str) -> dict:
"""Verifique uma empresa em um registro da jurisdição específica."""
registry = BUSINESS_REGISTRIES.get(jurisdiction)
if not registry:
return {"error": f"Jurisdição não suportada: {jurisdiction}"}
proxy = self.proxies[self.proxy_idx % len(self.proxies)]
self.proxy_idx += 1
# Pesquisar no registro
html = await self._search_registry(registry, company_name, proxy)
# Tratar CAPTCHA
if self._is_captcha(html):
token = await self._solve(registry)
html = await self._retry_search(registry, company_name, proxy, token)
# Analisar resultados
return self._parse_registry_result(html, registry)
async def _solve(self, registry: dict) -> str:
type_map = {
"ReCaptchaV2TaskProxyLess": CaptchaType.RECAPTCHA_V2,
"ImageToTextTask": CaptchaType.RECAPTCHA_V2 # Tratamento diferente
}
info = CaptchaInfo(
type=type_map[registry["captcha_type"]],
website_url=registry["url"],
website_key=registry.get("site_key", "")
)
solution = await self.cap.solve(info)
return solution.token
async def bulk_verify(self, companies: list, jurisdiction: str) -> list:
"""Verifique múltiplas empresas em lote."""
results = []
for company in companies:
result = await self.verify_company(company, jurisdiction)
results.append(result)
await asyncio.sleep(3) # Limitação de taxa respeitosa
return results
async def close(self):
await self.cap.aclose()
class CompanyVerificationAgent:
"""Camada de agente de IA para fluxos de verificação de empresas."""
def __init__(self, extractor: BusinessRegistryExtractor):
self.extractor = extractor
async def full_verification(self, company_name: str) -> dict:
"""Execute verificação completa em múltiplos registros."""
results = {}
# Verificar registros principais dos EUA
for jurisdiction in ["delaware_sos", "california_sos"]:
result = await self.extractor.verify_company(company_name, jurisdiction)
if result.get("status") == "Ativo":
results["us_registration"] = result
break
# Verificar SEC para empresas públicas
sec_result = await self.extractor.verify_company(company_name, "sec_edgar")
if sec_result.get("cik"):
results["sec_filing"] = sec_result
# Compilar relatório de verificação
return {
"company": company_name,
"verified": bool(results),
"registrations": results,
"verification_date": time.strftime("%Y-%m-%d")
}
| Caso de Verificação | Registros Verificados | CAPTCHAs por Verificação | Tempo por Empresa |
|---|---|---|---|
| Verificação básica | 1 registro estadual | 1 | 5-15 segundos |
| Multi-jurisdição | 3-5 registros | 3-5 | 20-60 segundos |
| Devido diligence completo | 5-8 registros + SEC | 5-8 | 45-120 segundos |
| Enriquecimento de leads em massa | 1 registro por empresa | 1 por empresa | 5-10 segundos cada |
| Volume | Verificações Mensais | CAPTCHAs Mensais | Custo Mensal |
|---|---|---|---|
| Pequeno (50/dia) | 1.500 | ~1.500 | $3-4,50 |
| Médio (200/dia) | 6.000 | ~6.000 | $12-18 |
| Grande (1.000/dia) | 30.000 | ~30.000 | $60-90 |
Claim Your Bonus Code: Use o código WEBS no Painel do CapSolver para obter um bônus adicional de 5% em cada recarga.
A Perguntas Frequentes do CapSolver sobre uso responsável aborda orientações adicionais de conformidade. Para lidar com reCAPTCHA em portais governamentais, o documento de solução v2 fornece detalhes de implementação. O guia de raspagem da web do CapSolver aborda padrões de infraestrutura para extração de dados em volume elevado.
A extração de dados de registros comerciais para agentes de IA requer o tratamento de sistemas de CAPTCHA diversos em bancos de dados governamentais em múltiplas jurisdições. CapSolver fornece a infraestrutura de verificação que permite consultas automatizadas de empresas em larga escala — resolvendo reCAPTCHA e CAPTCHAs de imagem em 3-12 segundos, de modo que seu agente de IA possa verificar empresas, enriquecer leads e completar verificações de conformidade sem intervenção manual.
Qualquer registro que use sistemas de CAPTCHA padrão: bancos de dados do Secretário de Estado dos EUA (todos os 50 estados), EDGAR da SEC, Companies House do Reino Unido, registros nacionais da UE e a maioria dos bancos de dados corporativos internacionais. Cada um requer identificação específica de parâmetros de CAPTCHA.
Sim. A maioria dos registros lista publicamente os diretores, executivos e agentes registrados. O motor de extração analisa esses campos junto com o status da empresa, data de formação e histórico de registros.
Alguns registros exigem criação de conta gratuita para pesquisas detalhadas. Seu agente de IA pode manter sessões autenticadas após a configuração inicial. Os CAPTCHAs normalmente aparecem nas páginas de login e de pesquisa — o CapSolver trata ambos.
A maioria dos registros governamentais fornece acesso público aos dados de registro de empresas. As políticas de acesso em massa variam por jurisdição — alguns permitem explicitamente, outros têm limites de taxa. Sempre verifique os termos específicos do registro e implemente limitação de taxa respeitosa (atrasos de 3-5 segundos entre consultas).
Rastreie quando o ChatGPT Search menciona sua marca em respostas geradas por IA com monitoramento automático.

Guia completo para criar pipelines de dados de produtos para e-commerce para agentes de IA com resolução de CAPTCHA.
