Integramos a Bright Data nos seus scrapers, fonte a fonte
Quando um site devolve 403, mostra CAPTCHAs ou corta por IP, ligamos o seu scraper à Bright Data: Web Unlocker para pedidos HTTP, Scraping Browser para páginas com JavaScript e proxies residenciais ou ISP para o resto. Ativamo-la nas fontes que precisam e medimos a taxa de sucesso de cada uma, para que o consumo corresponda ao problema.
A Bright Data é uma plataforma de acesso a dados web com redes de proxies (residenciais, de centro de dados, ISP e móveis) e produtos que resolvem o desbloqueio por si. O Web Unlocker gere CAPTCHAs, impressões digitais do navegador e novas tentativas por trás de um único pedido. O Scraping Browser é um navegador remoto a que se liga por CDP a partir do Playwright ou do Puppeteer. A SERP API devolve resultados de motores de busca já estruturados, e a Web Scraper API oferece extratores prontos para domínios grandes. Na Soamee integramo-la como mais uma estratégia dentro do scraper: cada fonte decide por configuração se sai direta ou através da Bright Data, com métricas de sucesso e consumo por fonte.
Os produtos da Bright Data que ligamos
A Bright Data tem muitos produtos e nem todos encaixam em cada projeto. Escolhemos por fonte, começando pelo mais simples que resolva o bloqueio.
Web Unlocker
Para fontes que bloqueiam clientes HTTP mas têm o conteúdo no HTML. Usa-se como um proxy ou via API: o pedido sai igual ao de antes e a Bright Data resolve CAPTCHAs, impressões digitais e novas tentativas. Encaixa nos scrapers que já tem, sem os reescrever.
Scraping Browser
Um navegador remoto na infraestrutura da Bright Data. O seu código de Playwright ou Puppeteer liga-se com connectOverCDP e o resto não muda: espera por seletores, scroll, clique em «carregar mais». E deixa de manter o Chromium no seu servidor.
Proxies residenciais, ISP e datacenter
Quando o problema é o IP ou a geolocalização: preços por país, conteúdo regional, limites por endereço. Configuramos zonas, país e sessões fixas ou rotativas consoante o que cada fonte pedir.
SERP API
Resultados do Google, do Bing e de outros motores de busca em JSON, por país e idioma. Serve para acompanhar posições, analisar a concorrência ou dar a um agente de IA acesso a pesquisas.
Web Scraper API e Datasets
Para domínios grandes que a Bright Data já extrai (marketplaces, redes profissionais, fichas de negócio em mapas) lançamos a extração por API e recolhemos o resultado, em vez de manter um scraper próprio. Antes comparamo-lo com o custo de o fazer à medida.
Controlo do consumo
Métricas por fonte: pedidos, taxa de sucesso, volume e custo estimado. Se uma fonte deixar de precisar de desbloqueio, volta a sair direta. E dispara um alerta quando o consumo se desvia do normal.
Que produto para cada bloqueio
É assim que decidimos em cada fonte. Se o primeiro teste resolver, não passamos para a Bright Data.
| Sintoma | Primeiro teste | Se não chegar |
|---|---|---|
| 403 ou redirecionamento para uma página de verificação com um cliente HTTP | Navegador headless próprio com cabeçalhos de navegador real | Web Unlocker |
| O conteúdo só aparece ao executar JavaScript e há proteção anti-bots | Playwright próprio | Scraping Browser |
| Funciona durante alguns pedidos e depois 429 ou bloqueio por IP | Baixar o ritmo e respeitar o Retry-After | Proxies residenciais ou ISP com rotação |
| O conteúdo muda consoante o país do visitante | Não há alternativa própria razoável | Proxies com país fixo |
| Precisa de resultados de motores de busca | Não há alternativa própria razoável | SERP API |
A Bright Data como mais uma estratégia
Não reescrevemos o scraper para usar a Bright Data. O transporte escolhe-se na configuração de cada fonte, e o resto do pipeline (normalização, deduplicação, alertas) não muda.
O Playwright e o Puppeteer ligam-se ao Scraping Browser sem tocar na lógica de extração
O Web Unlocker entra como mais um proxy em clientes como axios, fetch ou got
é a unidade: cada site decide se sai direto ou pela Bright Data
quando a taxa de sucesso ou o consumo de uma fonte saem do normal
Antes de ativar a Bright Data numa fonte testamos o caminho direto. Muitos sites que parecem blindados só rejeitam o User-Agent por defeito de uma biblioteca HTTP.
Ver o serviço de web scraping →Integração em quatro passos
Do diagnóstico de bloqueios ao acompanhamento do consumo, fonte a fonte.
Diagnóstico de bloqueios
Lançamos cada fonte em direto e anotamos o que falha: código HTTP, CAPTCHA, conteúdo vazio, corte por IP.
Produto e zona
Escolhemos o produto da Bright Data para cada fonte e guardamos zonas, países e credenciais como segredos do ambiente, nunca no código.
Integração e testes
Ligamos o cliente HTTP ou o navegador, acrescentamos smoke tests que passam pela Bright Data e medimos a taxa de sucesso real.
Acompanhamento do consumo
Painel por fonte e alertas. Todos os meses revemos que fontes poderiam voltar a sair diretas.
Perguntas frequentes sobre a Bright Data
Preciso de uma conta própria na Bright Data? +
Sim. A conta e a faturação ficam em seu nome e nós trabalhamos com credenciais de zona que pode revogar quando quiser. Assim não depende de nós para continuar a usá-la.
Web Unlocker ou Scraping Browser? +
Web Unlocker se o conteúdo estiver no HTML da resposta: é mais rápido e integra-se como um proxy. Scraping Browser se for preciso interagir com a página (scroll, cliques, esperar que um componente carregue). Num mesmo projeto é habitual usar os dois, cada um em fontes diferentes.
Podem integrá-la num scraper que já temos? +
Sim. O Web Unlocker e os proxies entram como configuração do cliente HTTP, e o Scraping Browser substitui o lançamento local do navegador por uma ligação remota. Revemos o seu código, ligamo-lo e acrescentamos as métricas por fonte.
Usar a Bright Data torna legal qualquer scraping? +
Não. A Bright Data resolve o acesso técnico, mas os limites legais são os mesmos: termos de utilização, direitos sobre bases de dados e RGPD se houver dados pessoais. A Bright Data aplica ainda a sua própria política de conformidade e pode recusar certos usos. Revemos isso antes de começar.
Quanto custa a Bright Data? +
Depende do produto e do volume: consoante o produto, cobra por pedido, por GB ou por resultado, e publica as suas tarifas. Antes de ativar o que quer que seja estimamos o consumo de cada fonte com um teste real, para que a fatura não seja uma surpresa.
Há alternativas à Bright Data? +
Sim: Oxylabs, Zyte, ScraperAPI ou Decodo oferecem produtos semelhantes. Trabalhamos sobretudo com a Bright Data pela variedade de produtos e, como o transporte se escolhe por fonte, mudar de fornecedor num site não obriga a mexer nos outros.
Também lhe pode interessar
Vamos rever as suas fontes bloqueadas
Envie-nos os URLs que lhe devolvem 403 ou CAPTCHA. Dizemos-lhe de que produto da Bright Data precisa cada um, ou se basta ajustar o scraper.
Vamos rever as suas fontes bloqueadasConte-nos seu desafio. Propomos uma solução.
Sem compromisso. Em menos de 24 horas, você recebe uma proposta com escopo, cronograma e orçamento. Sem letras miúdas.