Cách sử dụng AdsPower với Scrapingpass: Thiết lập và quy trình làm việc

By Anonymous☉ 3552 Views

Take a Quick Look

Kết hợp hồ sơ chống phát hiện AdsPower với API Scrapingpass để render trang JavaScript, xoay proxy và mở rộng thu thập dữ liệu đa tài khoản an toàn.

🔥 Limited-Time Offer! Save extra 10% off on your first monthly plan with code: Anitdetect10

Cách sử dụng AdsPower với Scrapingpass: Thiết lập và quy trình làm việc

Trình duyệt chống phát hiện và API thu thập dữ liệu giải quyết hai nửa của cùng một vấn đề. AdsPower cung cấp cho mỗi tác vụ một danh tính trình duyệt riêng biệt, trong khi Scrapingpass xử lý những phần phức tạp của việc tải trang ở quy mô lớn: render JavaScript, xoay proxy và né tránh anti-bot. Khi dùng cùng nhau, chúng cho phép bạn thu thập dữ liệu từ các trang chặn client HTTP thông thường mà không làm tổn hại đến tài khoản hoặc dấu vết bạn dựa vào.

Hướng dẫn này giải thích cách hai công cụ kết hợp với nhau, cách kết nối chúng và nơi mỗi công cụ nên đảm nhận phần việc nặng nhọc.

Tại sao nên kết hợp AdsPower và Scrapingpass?

Hầu hết các stack thu thập dữ liệu thất bại vì một trong hai lý do:

  • Yêu cầu trông giống bot. Một lệnh gọi requests trần trụi không có dấu vết trình duyệt, không cookie và không có hành vi TLS thực tế. Các trang có Cloudflare, DataDome hoặc giới hạn tốc độ tùy chỉnh sẽ từ chối ngay lập tức.
  • Phiên bị gắn cờ. Nếu bạn thu thập dữ liệu từ cùng IP hoặc hồ sơ trình duyệt mà bạn dùng cho tài khoản đã đăng nhập, bạn có nguy cơ liên kết hoạt động đó với tài khoản thật của mình.

AdsPower giải quyết vấn đề thứ hai. Nó tạo ra các môi trường trình duyệt biệt lập với dấu vết Canvas, WebGL, User Agent và IP duy nhất, vì vậy hồ sơ thu thập dữ liệu không bao giờ chia sẻ danh tính với tài khoản người bán Amazon hay tài khoản quảng cáo Facebook của bạn.

Scrapingpass giải quyết vấn đề thứ nhất. API REST của nó render các SPA nặng JavaScript thông qua Chrome headless, xoay qua một pool proxy dân cư lớn và trả về JSON đã phân tích, vì vậy bạn không phải duy trì đội trình duyệt của riêng mình.

Sự kết hợp này hữu ích khi bạn cần thu thập dữ liệu có xác thực — lấy dữ liệu từ các trang yêu cầu phiên đăng nhập — hoặc khi bạn muốn giữ lưu lượng thu thập dữ liệu tách biệt về mặt hình ảnh khỏi các tài khoản vận hành của mình.

Hai công cụ phân chia công việc như thế nào

Cách sử dụng AdsPower với Scrapingpass: Thiết lập và quy trình làm việc - Hai công cụ phân chia công việc như thế nào

Cách sử dụng AdsPower với Scrapingpass: Thiết lập và quy trình làm việc - Hai công cụ phân chia công việc như thế nào.

Tác vụ AdsPower Scrapingpass
Cô lập dấu vết trình duyệt Có Không
Phiên đăng nhập liên tục Có Hỗ trợ phiên qua API
Render JavaScript Có (qua hồ sơ) Có (Chrome headless)
Xoay proxy ở quy mô lớn Thủ công theo hồ sơ Pool tích hợp
Đầu ra JSON có cấu trúc Không Có
Quản lý đa tài khoản Có Không
Tự động hóa headless Có (Local API) Có (API-first)

Một nguyên tắc thực tế: dùng AdsPower khi mục tiêu yêu cầu danh tính trình duyệt đã đăng nhập, có dấu vết. Dùng Scrapingpass khi mục tiêu là công khai nhưng được bảo vệ bởi render JavaScript hoặc giới hạn tốc độ. Dùng cả hai khi bạn cần truy cập đã đăng nhập với khối lượng lớn.

Điều kiện tiên quyết

Trước khi bắt đầu, hãy đảm bảo bạn có:

  • AdsPower đã cài đặt (v3.3.2 trở lên nếu bạn định dùng chế độ headless)
  • Tài khoản Scrapingpass với API key từ dashboard của bạn
  • Python 3.10+ nếu bạn muốn script hóa quy trình
  • Ít nhất một proxy được cấu hình trong AdsPower nếu bạn thu thập dữ liệu từ một khu vực cụ thể

Nếu bạn mới làm quen với lớp tự động hóa của AdsPower, hướng dẫn tự động hóa Python sẽ trình bày những kiến thức cơ bản về Local API trước khi bạn thêm API thu thập dữ liệu lên trên.

Bước 1: Tạo hồ sơ thu thập dữ liệu chuyên dụng trong AdsPower

Cách sử dụng AdsPower với Scrapingpass: Thiết lập và quy trình làm việc - Bước 1: Tạo hồ sơ thu thập dữ liệu chuyên dụng trong AdsPower

Cách sử dụng AdsPower với Scrapingpass: Thiết lập và quy trình làm việc - Bước 1: Tạo hồ sơ thu thập dữ liệu chuyên dụng trong AdsPower.

Hãy tách việc thu thập dữ liệu khỏi các tài khoản tạo doanh thu của bạn. Tạo một hồ sơ mới dành riêng cho việc thu thập dữ liệu.

  1. Mở AdsPower và nhấp New Profile.
  2. Đặt tên rõ ràng, ví dụ scraper-us-east.
  3. Đặt User Agent và nền tảng phù hợp với khu vực mục tiêu của bạn.
  4. Gán một proxy. Nếu bạn đã dùng một nhà cung cấp, hướng dẫn thiết lập MyPrivateProxy sẽ hướng dẫn cách thêm proxy chuyên dụng và xác minh IP.
  5. Lưu hồ sơ và ghi lại profile ID — bạn sẽ cần nó cho các lệnh gọi API.

Hồ sơ này trở thành danh tính thu thập dữ liệu của bạn. Không dùng lại nó cho các hoạt động tài khoản.

Bước 2: Bật AdsPower Local API

Local API cho phép bạn khởi động, dừng và truy vấn hồ sơ theo chương trình. Nó lắng nghe trên http://127.0.0.1:50325 theo mặc định.

  1. Trong AdsPower, vào Automation → API.
  2. Xác nhận trạng thái kết nối hiển thị là đang hoạt động.
  3. Nhấp Generate để tạo API key của bạn. Thành viên nhóm cần được quản trị viên gán quyền này.
  4. Nếu bạn muốn chạy mà không có cửa sổ hiển thị, hãy khởi động AdsPower ở chế độ headless:
"AdsPower Global.exe" --headless=true --api-key=XXXX --api-port=50325

Trên macOS, lệnh tương đương sử dụng đường dẫn gói ứng dụng:

"/Applications/AdsPower Global.app/Contents/MacOS/AdsPower Global" --args --headless=true --api-key=XXXX --api-port=50325

Chế độ headless và chế độ GUI không thể chạy trên cùng một thiết bị cùng lúc. Nếu bạn cần giao diện, hãy bỏ qua headless và dùng GUI thay thế.

Bước 3: Khởi động hồ sơ và lấy endpoint gỡ lỗi

Khi bạn khởi động một hồ sơ qua Local API, AdsPower trả về một endpoint gỡ lỗi WebSocket. Endpoint đó là thứ bạn gắn Selenium hoặc Playwright vào.

curl "http://127.0.0.1:50325/api/v1/browser/start?user_id=YOUR_PROFILE_ID"

Phản hồi bao gồm trường ws với địa chỉ Chrome DevTools Protocol. Bạn có thể truyền nó cho Playwright hoặc Selenium để điều khiển trực tiếp trình duyệt có dấu vết.

Đối với một client Python có kiểu dữ liệu xử lý việc tạo hồ sơ, gán proxy và gắn Selenium/Playwright, SDK cộng đồng tại CrocoFactory/adspower bao bọc Local API và quản lý vòng đời trình duyệt cho bạn.

Bước 4: Định tuyến yêu cầu qua Scrapingpass

Bây giờ sự phân chia trở nên rõ ràng. Bạn có hai lựa chọn tùy thuộc vào nhu cầu của mục tiêu.

Tùy chọn A: Scrapingpass xử lý việc tải, AdsPower xử lý danh tính

Dùng cách này khi mục tiêu là công khai nhưng nặng JavaScript. Gửi URL đến API Scrapingpass và để nó render trang:

curl "https://scrapingpass.com/api/v1/scrape" \
  -H "Authorization: Bearer YOUR_SCRAPINGPASS_KEY" \
  -d '{
    "url": "https://example.com/products",
    "render_js": true,
    "country": "us",
    "session": "scrape-run-001"
  }'

Tham số session giữ nguyên IP proxy qua nhiều yêu cầu, điều này quan trọng khi một trang gắn trạng thái giỏ hàng hoặc tìm kiếm với IP của bạn. Tham số country nhắm mục tiêu địa lý cho proxy dân cư.

Tùy chọn B: AdsPower điều khiển trình duyệt, Scrapingpass cung cấp proxy

Dùng cách này khi mục tiêu yêu cầu đăng nhập. Khởi động hồ sơ AdsPower, gắn Playwright và trỏ trình duyệt đến mục tiêu. Nếu bạn muốn dùng pool dân cư của Scrapingpass thay vì proxy tĩnh, hãy cấu hình endpoint proxy trong hồ sơ AdsPower trước khi khởi chạy.

from playwright.sync_api import sync_playwright
import requests

# 1. Khởi động hồ sơ AdsPower
resp = requests.get(
    "http://127.0.0.1:50325/api/v1/browser/start",
    params={"user_id": "YOUR_PROFILE_ID"}
)
ws_endpoint = resp.json()["data"]["ws"]["puppeteer"]

# 2. Gắn Playwright vào trình duyệt có dấu vết
with sync_playwright() as p:
    browser = p.chromium.connect_over_cdp(ws_endpoint)
    page = browser.contexts[0].pages[0]
    page.goto("https://target-site.com/dashboard")
    data = page.inner_text("table.results")
    print(data)

Mẫu này giữ phiên đăng nhập bên trong hồ sơ biệt lập của AdsPower trong khi bạn kiểm soát logic điều hướng bằng Python.

Bước 5: Xác minh thiết lập trước khi mở rộng

Trước khi chạy hàng nghìn yêu cầu, hãy xác nhận ba điều:

  1. Dấu vết là duy nhất. Kiểm tra https://browserleaks.com/canvas bên trong hồ sơ AdsPower. Nó không được trùng với bất kỳ hồ sơ nào khác.
  2. IP proxy đúng như bạn mong đợi. Truy cập một trang tra cứu IP và xác nhận quốc gia và ASN.
  3. Scrapingpass trả về HTML đã render. Thêm render_js: true và kiểm tra rằng nội dung động xuất hiện trong phản hồi, không chỉ là shell trống.

Nếu bất kỳ điều nào thất bại, hãy sửa chúng trước khi thêm đồng thời. Gỡ lỗi một dấu vết bị hỏng qua 50 yêu cầu song song khó hơn nhiều so với gỡ lỗi một yêu cầu.

Các trường hợp sử dụng thực tế

Giám sát giá trên các sàn thương mại điện tử

Tạo một hồ sơ AdsPower cho mỗi khu vực sàn. Dùng Scrapingpass để tải trang sản phẩm với render_js: true và country được đặt để khớp với khu vực địa phương của sàn. Lưu kết quả vào cơ sở dữ liệu và so sánh hàng ngày.

Nghiên cứu quảng cáo đối thủ

Thư viện quảng cáo trên Meta và TikTok yêu cầu render JavaScript và thường giới hạn tốc độ theo IP. Pool dân cư xoay của Scrapingpass xử lý giới hạn tốc độ; AdsPower giữ các phiên nghiên cứu của bạn tách biệt khỏi tài khoản quảng cáo thực tế.

Xuất dashboard có xác thực

Khi cổng thông tin nhà cung cấp hoặc dashboard affiliate yêu cầu đăng nhập, hãy chạy phiên bên trong hồ sơ AdsPower và dùng Local API để xuất dữ liệu theo lịch. Hồ sơ duy trì đăng nhập; Scrapingpass không cần ở đây trừ khi dashboard cũng chặn IP datacenter.

Các vấn đề thường gặp và cách khắc phục

Hồ sơ không khởi động ở chế độ headless. Kiểm tra phiên bản AdsPower của bạn là v3.3.2 trở lên và phiên bản kernel là v2.4.2.8 trở lên. Các phiên bản cũ hơn không hỗ trợ cờ --headless.

API key ngừng hoạt động sau khi reset. Việc reset key sẽ vô hiệu hóa key trước đó ngay lập tức. Bạn phải dừng dịch vụ đang chạy và khởi động lại với key mới.

Scrapingpass trả về nội dung trống. Trang có thể tải dữ liệu sau một lệnh gọi XHR. Xác nhận render_js được bật và cân nhắc thêm thời gian chờ ngắn hoặc nhắm trực tiếp đến endpoint API mà trang gọi.

Yêu cầu bị chặn dù đã xoay proxy. Một số trang lấy dấu vết TLS hoặc yêu cầu ngữ cảnh trình duyệt thật. Trong trường hợp đó, hãy chuyển sang Tùy chọn B và điều khiển yêu cầu qua trình duyệt của AdsPower thay vì API.

Trạng thái phiên bị rò rỉ giữa các lần chạy. Dùng giá trị session duy nhất trong Scrapingpass cho mỗi lần chạy logic, và xóa cookie trong hồ sơ AdsPower giữa các tác vụ lớn.

Đọc thêm

Nguồn và đọc thêm

  • Hướng dẫn sử dụng trình duyệt chống phát hiện AdsPower - Tìm hiểu cách sử dụng trình duyệt không thể phát hiện AdsPower để giải quyết nhu cầu của bạn với các hướng dẫn từng bước, giúp bạn quản lý tác vụ hiệu quả.
  • API - Local API cho phép người dùng đọc và ghi thông tin cấu hình, khởi động và đóng trình duyệt, tìm kiếm tài khoản, v.v. Để biết thêm chi tiết, vui lòng nhấp vào đây để nhận tài liệu Local API. Nhấp vào đây t

Câu hỏi thường gặp

Tôi có cần Scrapingpass nếu đã dùng AdsPower không?

Không phải lúc nào cũng vậy. Nếu mục tiêu của bạn là các trang HTML đơn giản không có bảo vệ anti-bot, chỉ AdsPower là đủ. Scrapingpass mang lại giá trị khi bạn cần render JavaScript, pool proxy xoay lớn hoặc đầu ra JSON có cấu trúc mà không phải duy trì cơ sở hạ tầng riêng.

Tôi có thể dùng proxy Scrapingpass trong hồ sơ AdsPower không?

Có. Cấu hình endpoint proxy trong cài đặt hồ sơ AdsPower trước khi khởi chạy. Hồ sơ sẽ định tuyến tất cả lưu lượng trình duyệt qua proxy đó, bao gồm các yêu cầu được thực hiện bởi script gắn qua Local API.

Local API của AdsPower có hoạt động trực tiếp với Scrapingpass không?

Không trực tiếp — chúng giải quyết các lớp khác nhau. AdsPower cung cấp API HTTP cục bộ để điều khiển trình duyệt. Scrapingpass cung cấp API HTTP từ xa để tải trang. Bạn điều phối chúng từ script của riêng mình, gọi từng cái ở nơi phù hợp.

Chế độ headless có bắt buộc để thu thập dữ liệu với AdsPower không?

Không, nhưng nó được khuyến nghị cho tự động hóa phía máy chủ. Chế độ headless cho phép bạn chạy hồ sơ mà không có cửa sổ hiển thị và điều khiển nhiều thiết bị bằng một API key. Chế độ GUI giới hạn bạn ở một tài khoản đã đăng nhập mỗi thiết bị.

Tôi có thể chạy bao nhiêu yêu cầu đồng thời?

Điều đó phụ thuộc vào gói Scrapingpass của bạn và số lượng hồ sơ AdsPower. Bắt đầu với đồng thời thấp, đo tỷ lệ chặn và tăng dần. Chạy 50 hồ sơ cùng lúc trên gói được thiết kế cho 5 yêu cầu đồng thời sẽ tạo ra lỗi trông giống như vấn đề dấu vết nhưng thực chất là giới hạn tốc độ.

Kết luận

AdsPower và Scrapingpass bổ sung cho nhau, không cạnh tranh. AdsPower sở hữu danh tính trình duyệt — dấu vết, phiên và cô lập tài khoản. Scrapingpass sở hữu lớp tải — render, xoay proxy và đầu ra có cấu trúc. Các quy trình sạch nhất dùng AdsPower khi đăng nhập hoặc dấu vết quan trọng, Scrapingpass khi khối lượng và né tránh anti-bot quan trọng, và cả hai khi bạn cần truy cập có xác thực ở quy mô lớn.

Bắt đầu với một hồ sơ và một lệnh gọi API. Xác minh dấu vết, xác nhận vị trí proxy và kiểm tra rằng nội dung đã render thực sự xuất hiện. Khi một yêu cầu đó hoạt động đáng tin cậy, việc mở rộng chỉ là thêm hồ sơ và đồng thời — và biết công cụ nào nên xử lý phần nào của công việc.

AI INSIGHTS

Need a Quick Summary? Ask AI