
Ethan Collins
Pattern Recognition Specialist

AI驱动的电商代理需要结构化的商品数据——价格、描述、库存状态、评论和竞争对手列表——以提供个性化推荐、动态定价和市场情报。主要的电商平台通过CAPTCHA系统保护这些数据,阻止在几十次请求后自动收集。本指南介绍了如何构建用于AI代理的生产级电商产品数据流水线,使用CapSolver持续访问亚马逊、Shopify商店和市场平台。
电商平台上包含互联网上最具商业价值的商品数据。定价情报、库存水平、产品规格和客户评论每年驱动数万亿美元的购买决策。这些平台在机器人防护上投入巨大,因为竞争对手、价格聚合器和数据经销商都想要这些信息。
当AI电商代理尝试大规模收集商品数据时——比较不同卖家的价格、监控库存变化、聚合评论进行情感分析——它会产生触发验证挑战的请求模式。Cloudflare的机器人管理研究显示,电商平台是所有行业中机器人流量最高的行业之一,导致了严格的防护阈值。
电商平台的CAPTCHA环境是多样的:亚马逊使用自定义的图片CAPTCHA,Shopify商店部署Cloudflare Turnstile,eBay使用reCAPTCHA v2,而沃尔玛则使用带有额外行为检查的Turnstile。AI代理的数据流水线必须处理所有这些类型以保持全面的产品覆盖。
pip install git+https://github.com/capsolver-ai/capsolver-core.git
pip install aiohttp beautifulsoup4 pandas
export CAPSOLVER_API_KEY="your-capsolver-api-key"
其他要求:
ECOMMERCE_PLATFORMS = {
"amazon": {
"captcha_type": "ImageToTextTask",
"trigger": "after_80_requests_or_rapid_navigation",
"data": ["title", "price", "rating", "reviews_count", "availability", "seller"]
},
"shopify_stores": {
"captcha_type": "AntiTurnstileTaskProxyLess",
"trigger": "cloudflare_managed_challenge",
"data": ["title", "price", "variants", "inventory", "description", "images"]
},
"ebay": {
"captcha_type": "ReCaptchaV2TaskProxyLess",
"trigger": "after_60_searches",
"data": ["title", "price", "bids", "seller_rating", "shipping", "condition"]
},
"walmart": {
"captcha_type": "AntiTurnstileTaskProxyLess",
"trigger": "rate_limit_and_behavioral",
"data": ["title", "price", "availability", "pickup_options", "reviews"]
}
}
import asyncio
from capsolver_core import create_capsolver, CaptchaType, CaptchaInfo
class EcommerceDataCollector:
"""收集电商产品数据并处理CAPTCHA。"""
def __init__(self, api_key: str, proxies: list):
self.cap = create_capsolver(api_key=api_key)
self.proxies = proxies
self.proxy_idx = 0
async def collect_product(self, url: str, platform: str) -> dict:
"""从特定URL收集产品数据并处理CAPTCHA。"""
proxy = self.proxies[self.proxy_idx % len(self.proxies)]
self.proxy_idx += 1
html = await self._fetch(url, proxy)
if self._is_captcha(html):
token = await self._solve(platform, url)
html = await self._retry(url, proxy, token)
return self._parse_product(html, platform)
async def _solve(self, platform: str, url: str) -> str:
config = ECOMMERCE_PLATFORMS[platform]
type_map = {
"ImageToTextTask": CaptchaType.RECAPTCHA_V2, # 处理方式不同
"ReCaptchaV2TaskProxyLess": CaptchaType.RECAPTCHA_V2,
"AntiTurnstileTaskProxyLess": CaptchaType.CLOUDFLARE
}
info = CaptchaInfo(
type=type_map.get(config["captcha_type"], CaptchaType.RECAPTCHA_V2),
website_url=url,
website_key=config.get("site_key", "")
)
solution = await self.cap.solve(info)
return solution.token
async def monitor_prices(self, product_urls: list, platform: str) -> list:
"""监控一组产品的价格。"""
results = []
for url in product_urls:
data = await self.collect_product(url, platform)
results.append(data)
await asyncio.sleep(5)
return results
async def close(self):
await self.cap.aclose()
| 用例 | 所需数据 | 收集频率 | 价值 |
|---|---|---|---|
| 价格比较 | 不同卖家的价格 | 每2-4小时 | 动态定价决策 |
| 库存监控 | 库存水平、可用性 | 每1-2小时 | 供应链警报 |
| 评论聚合 | 评分、评论文本 | 每日 | 情感分析 |
| 竞争对手跟踪 | 新产品、价格变化 | 每日 | 市场情报 |
| 产品匹配 | 标题、规格、图片 | 每周 | 目录丰富 |
| 规模 | 每日产品数 | 每月CAPTCHA数 | 每月成本 |
|---|---|---|---|
| 小型(100产品) | 400次检查 | ~1,200 | $2.40-3.60 |
| 中型(1,000产品) | 2,000次检查 | ~6,000 | $12-18 |
| 大型(10,000产品) | 10,000次检查 | ~30,000 | $60-90 |
优化策略:会话持久化可减少40-60%的遭遇次数,智能调度在非高峰时段可减少15-25%,住宅代理可减少30-40%。
领取您的优惠码:在CapSolver仪表板使用代码WEBS,每次充值可额外获得5%的奖励。
CapSolver电商CAPTCHA指南涵盖平台特定的实现模式。对于受Cloudflare Turnstile保护的Shopify商店,Turnstile文档提供了详细的代码示例。CapSolver网络爬虫指南涵盖大规模收集的基础设施最佳实践。
AI代理的电商产品数据收集需要处理亚马逊、Shopify、eBay和沃尔玛等平台的多样化CAPTCHA系统。CapSolver通过单一API提供统一的求解基础设施,可处理图片CAPTCHA、reCAPTCHA和Cloudflare Turnstile,从而实现大规模的持续数据收集。住宅代理、会话管理和自动化求解的结合为AI代理提供了可靠的电商数据,用于定价、推荐和竞争情报。
所有使用标准CAPTCHA系统的主流平台:亚马逊、Shopify商店、eBay、沃尔玛、塔吉特、百思买和大多数市场平台。每个平台都需要特定的CAPTCHA参数识别。
典型字段包括标题、价格、可用性、卖家信息、评分、评论数、产品规格、图片和变体选项。具体字段取决于平台和产品类别。
收集公开显示的产品信息(价格、描述、可用性)通常允许用于价格比较和市场分析。请查阅评论平台的服务条款和您所在司法管辖区的相关法律。专注于公开可访问的数据,而非登录后的内容。