
Anh Tuan
Data Science Expert

Các trợ lý AI hỗ trợ theo dõi mạng xã hội, giám sát thương hiệu và nghiên cứu thị trường cần dữ liệu có cấu trúc từ các hồ sơ, bài đăng và chỉ số tương tác trên mạng xã hội công khai. Các nền tảng mạng xã hội triển khai các biện pháp bảo vệ CAPTCHA và bot mạnh mẽ, chặn việc thu thập dữ liệu tự động — ngay cả với thông tin có sẵn công khai. Hướng dẫn này sẽ hướng dẫn bạn xây dựng luồng dữ liệu mạng xã hội công khai cho các trợ lý AI sử dụng CapSolver để duy trì truy cập liên tục vào dữ liệu nền tảng.
Các trợ lý AI thực hiện theo dõi mạng xã hội, thông tin cạnh tranh và nghiên cứu thị trường cần truy cập vào dữ liệu mạng xã hội công khai. Các đề cập thương hiệu, chủ đề đang thịnh hành, mẫu tương tác và cảm xúc công khai đều được rút ra từ nội dung được đăng tải công khai. Tuy nhiên, các nền tảng mạng xã hội triển khai nhiều lớp bảo vệ bot để quản lý truy cập tự động.
Khi một trợ lý AI cố gắng thu thập bài đăng công khai, thông tin hồ sơ hoặc chỉ số tương tác ở quy mô lớn, nó sẽ kích hoạt các thách thức xác minh.
pip install git+https://github.com/capsolver-ai/capsolver-core.git
pip install aiohttp beautifulsoup4 pandas
export CAPSOLVER_API_KEY="your-capsolver-api-key"
SOCIAL_PLATFORMS = {
"reddit_public": {
"name": "Reddit (Công khai)",
"captcha_type": "ReCaptchaV2TaskProxyLess",
"trigger": "rate_limit_after_30_pages",
"public_data": ["posts", "comments", "upvotes", "subreddit_stats"]
},
"twitter_public": {
"name": "X/Twitter (Công khai)",
"captcha_type": "AntiTurnstileTaskProxyLess",
"trigger": "behavioral_and_rate",
"public_data": ["tweets", "likes", "retweets", "follower_count"]
},
"linkedin_public": {
"name": "LinkedIn (Hồ sơ công khai)",
"captcha_type": "AntiTurnstileTaskProxyLess",
"trigger": "after_20_profile_views",
"public_data": ["name", "headline", "company", "public_posts"]
},
"review_platforms": {
"name": "G2/Trustpilot/Capterra",
"captcha_type": "ReCaptchaV2TaskProxyLess",
"trigger": "after_50_reviews_viewed",
"public_data": ["reviews", "ratings", "company_scores", "feature_mentions"]
}
}
import asyncio
from capsolver_core import create_capsolver, CaptchaType, CaptchaInfo
from dataclasses import dataclass
from typing import List
@dataclass
class SocialDataPoint:
platform: str
content_type: str
text: str
engagement: dict
author: str
timestamp: float
url: str
class SocialDataCollector:
def __init__(self, api_key: str, proxies: list):
self.cap = create_capsolver(api_key=api_key)
self.proxies = proxies
self.proxy_idx = 0
async def collect_public_posts(self, platform: str, query: str, max_pages: int = 5) -> List[SocialDataPoint]:
results = []
for page in range(max_pages):
proxy = self.proxies[self.proxy_idx % len(self.proxies)]
self.proxy_idx += 1
html = await self._fetch(platform, query, page, proxy)
if self._is_captcha(html):
token = await self._solve(platform)
html = await self._retry(platform, query, page, proxy, token)
posts = self._parse_posts(html, platform)
results.extend(posts)
if not posts:
break
await asyncio.sleep(5)
return results
async def _solve(self, platform_key: str) -> str:
config = SOCIAL_PLATFORMS[platform_key]
type_map = {
"ReCaptchaV2TaskProxyLess": CaptchaType.RECAPTCHA_V2,
"AntiTurnstileTaskProxyLess": CaptchaType.CLOUDFLARE
}
info = CaptchaInfo(
type=type_map[config["captcha_type"]],
website_url=f"https://www.{platform_key.split('_')[0]}.com",
website_key=config.get("site_key", "")
)
solution = await self.cap.solve(info)
return solution.token
async def monitor_brand_mentions(self, brand: str, platforms: list) -> dict:
all_mentions = []
for platform in platforms:
posts = await self.collect_public_posts(platform, brand)
mentions = [p for p in posts if brand.lower() in p.text.lower()]
all_mentions.extend(mentions)
return {
"brand": brand,
"total_mentions": len(all_mentions),
"by_platform": {p: len([m for m in all_mentions if m.platform == p]) for p in platforms}
}
async def close(self):
await self.cap.aclose()
| Trường hợp sử dụng | Dữ liệu cần thiết | Nền tảng | Giá trị |
|---|---|---|---|
| Cảm xúc thương hiệu | Các đề cập công khai + tương tác | Reddit, Twitter, Đánh giá | Sức khỏe thương hiệu thời gian thực |
| Thông tin cạnh tranh | Các đề cập đối thủ + cảm xúc | Tất cả nền tảng | Vị trí thị trường |
| Phát hiện xu hướng | Số lượng bài đăng + chủ đề theo thời gian | Reddit, Twitter | Nhận diện xu hướng sớm |
| Tạo cơ hội kinh doanh | Hồ sơ chuyên nghiệp công khai | LinkedIn (công khai) | Dữ liệu tiếp thị bán hàng |
| Phản hồi sản phẩm | Đánh giá + đề cập tính năng | G2, Capterra, Trustpilot | Góp ý phát triển sản phẩm |
| Phạm vi theo dõi | Số lần thu thập hàng ngày | Số CAPTCHA hàng tháng | Chi phí hàng tháng |
|---|---|---|---|
| 1 thương hiệu, 2 nền tảng | ~60 trang | ~540 | $1.08-1.62 |
| 5 thương hiệu, 3 nền tảng | ~450 trang | ~4,050 | $8.10-12.15 |
| 20 thương hiệu, 4 nền tảng | ~2,400 trang | ~21,600 | $43-65 |
Nhận Mã Khuyến Mãi: Sử dụng mã WEBS tại Bảng điều khiển CapSolver để nhận thêm 5% khuyến mãi cho mỗi lần nạp tiền.
FAQ của CapSolver về sử dụng có trách nhiệm cung cấp hướng dẫn bổ sung. Hướng dẫn quét web của CapSolver đề cập đến các mô hình cơ sở hạ tầng. Đối với các nền tảng được bảo vệ bởi Cloudflare, tài liệu Turnstile cung cấp chi tiết triển khai.
Việc thu thập dữ liệu công khai từ mạng xã hội cho các trợ lý AI đòi hỏi phải xử lý các hệ thống bảo vệ đa dạng trên các nền tảng trong khi duy trì ranh giới đạo đức nghiêm ngặt. CapSolver cung cấp cơ sở hạ tầng giải mã xác minh, cho phép truy cập liên tục vào dữ liệu mạng xã hội công khai — giải mã reCAPTCHA và Cloudflare Turnstile trong 3-12 giây.
Việc thu thập thông tin được đăng tải công khai thường được phép ở hầu hết các khu vực. Tuy nhiên, điều khoản dịch vụ của nền tảng có thể hạn chế truy cập tự động. Luôn tham khảo ý kiến luật sư cho trường hợp cụ thể của bạn.
Các nền tảng có bảo vệ CAPTCHA tiêu chuẩn: Reddit (các diễn đàn công khai), X/Twitter (các bài đăng công khai), LinkedIn (hồ sơ công khai), các trang đánh giá (G2, Trustpilot, Capterra) và các diễn đàn cộng đồng.
Dữ liệu công khai bao gồm: nội dung bài đăng, chỉ số tương tác (lượt thích, chia sẻ, bình luận), thời gian đăng bài, thông tin hồ sơ công khai của tác giả, hashtag và liên kết phương tiện. Tin nhắn riêng tư và các trường hồ sơ không công khai sẽ không bao giờ được thu thập.
Học kiến trúc gỡ mã web Rust có thể mở rộng với reqwest, scraper, gỡ mã bất đồng bộ, gỡ mã trình duyệt không đầu, xoay proxy và xử lý CAPTCHA tuân thủ.

Tự động hóa việc giải CAPTCHA với Nanobot và CapSolver. Sử dụng Playwright để giải reCAPTCHA và Cloudflare tự động.
