Frameworks de automação
Como integrar Selenium, Puppeteer, Playwright, Scrapy e outros frameworks de automação e coleta de dados. Em todos os exemplos, basta substituir USERNAME e PASSWORD pelas suas credenciais.
Scrapy
Habilite o middleware de proxy no settings.py ou defina o proxy por requisição:
# Opção 1: global (settings.py)
HTTPPROXY_ENABLED = True
# No Spider, defina o proxy para cada requisição
def start_requests(self):
proxy = "http://USERNAME-pool-flow-region-US:[email protected]:23333"
for url in self.start_urls:
yield scrapy.Request(url, meta={"proxy": proxy})
A rotação a cada requisição é o comportamento padrão e casa naturalmente com o modelo de concorrência do Scrapy; quando precisar fixar o IP por sessão, adicione o sid ao username.
Selenium (Python)
Os argumentos de linha de comando do Chrome não aceitam proxy com autenticação; recomendamos o selenium-wire para lidar com usuário e senha:
# pip install selenium-wire
from seleniumwire import webdriver
options = {
"proxy": {
"http": "http://USERNAME-pool-flow-region-US:[email protected]:23333",
"https": "http://USERNAME-pool-flow-region-US:[email protected]:23333",
}
}
driver = webdriver.Chrome(seleniumwire_options=options)
driver.get("https://ipinfo.io")
print(driver.page_source)
driver.quit()
Também é possível usar o modo whitelist: depois de extrair endpoints IP:porta sem autenticação, use diretamente o argumento nativo --proxy-server.
Puppeteer (Node.js)
const puppeteer = require("puppeteer");
(async () => {
const browser = await puppeteer.launch({
args: ["--proxy-server=http://proxy.eproxies.net:23333"],
});
const page = await browser.newPage();
await page.authenticate({
username: "USERNAME-pool-flow-region-US",
password: "PASSWORD",
});
await page.goto("https://ipinfo.io/json");
console.log(await page.evaluate(() => document.body.innerText));
await browser.close();
})();
Playwright (Node.js / Python)
// Node.js
const { chromium } = require("playwright");
(async () => {
const browser = await chromium.launch({
proxy: {
server: "http://proxy.eproxies.net:23333",
username: "USERNAME-pool-flow-region-US",
password: "PASSWORD",
},
});
const page = await browser.newPage();
await page.goto("https://ipinfo.io/json");
console.log(await page.textContent("body"));
await browser.close();
})();
# Python
from playwright.sync_api import sync_playwright
with sync_playwright() as p:
browser = p.chromium.launch(proxy={
"server": "http://proxy.eproxies.net:23333",
"username": "USERNAME-pool-flow-region-US",
"password": "PASSWORD",
})
page = browser.new_page()
page.goto("https://ipinfo.io/json")
print(page.text_content("body"))
browser.close()
Pipelines de dados para AI Agents / LLMs
Ao usar LLMs para controlar navegadores ou coletar dados (ferramentas do LangChain, Browser Use, agents próprios etc.), basta passar a configuração de proxy de qualquer um dos frameworks acima. Pontos-chave:
- Atribua um
sidindependente a cada agent paralelo, para que não interfiram entre si (exemplo de múltiplas sessões). - Faça o agent requisitar
https://ipinfo.iono início da tarefa para validar o IP de saída antes de executar o trabalho. - Sintaxe completa de parâmetros em uma única página: Referência rápida para Agents.
Ferramentas de coleta de dados
Tutoriais oficiais de configuração das ferramentas visuais de coleta: Octoparse · Scrapy · ScrapeStorm · SellerSprite · Helium 10
