Uma definição clara: ler dados de uma página após ela ser renderizada dentro da sua própria aba do navegador, sem um servidor ou uma API intermediários.
Banco de dados··7 minutos de leitura
Principais conclusões
Extração de dados baseada em navegador Lê os dados de uma página depois que ela é totalmente carregada em uma aba real do navegador, o mesmo conteúdo que você vê na tela
Ele lida com sites que utilizam muito JavaScript, como o Google Maps, que constroem seu conteúdo dinamicamente, onde solicitações simples ao servidor retornam uma casca vazia
A Vonsel utiliza esse método por meio de uma extensão gratuita para o Chrome: captura empresas do mapa e, em seguida, as insere em um CRM mapeado com avaliações e inteligência artificial de e-mail
Definição
O que significa, de fato, a extração de dados baseada em navegador
Extração de dados baseada em navegador é um método de coleta de dados que consiste em ler uma página da web após ela ter sido totalmente renderizada em uma aba real do navegador. Em vez de solicitar dados estruturados a um servidor remoto, a ferramenta inspeciona o mesmo conteúdo que seu navegador exibiu na tela. Ela lê o conteúdo em tempo real Modelo de Objeto de Documento, a árvore de elementos que um navegador cria a partir de HTML, CSS e JavaScript.
Isso é importante porque os sites modernos raramente enviam uma página finalizada. Eles enviam um esqueleto HTML simples, que é preenchido com conteúdo por JavaScript após o carregamento da página. Uma requisição simples ao servidor vê apenas o esqueleto, nada mais. Um navegador vê a página finalizada, assim como um programa de extração de dados (scraping) que é executado dentro dela. O navegador realiza o trabalho pesado de renderização, e o scraper simplesmente lê o resultado..
Na prática, a extração de dados baseada em navegador geralmente funciona como uma extensão do Chrome ou um pequeno script em um navegador sem interface gráfica. A versão mais comum é a extensão, pois utiliza a sessão, os cookies e a visualização que você já tem aberta. Sem servidores para configurar, sem chaves de API para gerenciar.
Veja a extração de dados baseada em navegador em ação
Adicione a extensão Vonsel ao Chrome, abra o Google Maps e capture uma lista de empresas diretamente da página exibida. Download gratuito. Sem período de teste, sem necessidade de cartão de crédito.
Nos bastidores, um scraper baseado em navegador segue um loop simples. Ele não quebra nada e não oculta o tráfego: lê o que a página já exibe.
1. A página é renderizada. Você abre uma pesquisa no Google Maps e o navegador executa o JavaScript do site para exibir resultados, cartões e detalhes.
2. O scraper lê o DOM. Executado dentro da aba, ele percorre a árvore de elementos e extrai os campos que reconhece: nomes, endereços, números de telefone, avaliações e links. Para uma lista mais completa, consulte nossa nota sobre Explicação dos campos de dados do Google Maps..
3. Ela estrutura os dados. O texto solto na página se transforma em linhas limpas, uma empresa por registro, prontas para exportação ou para um CRM.
4. Ele repassa o resultado. Com o Vonsel, a lista capturada é integrada a um painel mapeado em vez de uma planilha isolada, tornando os dados utilizáveis assim que são recebidos.
DOM
O scraper lê a árvore de elementos renderizada, não o código HTML bruto
0
Chaves de API ou servidores de back-end necessários para executar uma captura baseada em navegador
1 aba
Tudo acontece dentro da aba do Chrome que você já tem aberta
Comparação
Raspagem de dados baseada em navegador vs. API vs. raspagem de dados do servidor
Existem três maneiras comuns de coletar dados da web, e elas apresentam vantagens e desvantagens em diferentes aspectos. A tabela abaixo serve como referência rápida.
Aspecto
Baseado em navegador
Extração de dados de API
Extração de dados do lado do servidor
Onde ele corre
Sua aba do navegador
Ponto final remoto
Um script de backend
Renderiza JavaScript
Sim
N / D
Muitas vezes não
São necessárias chaves de API
Não
Geralmente
Às vezes
Utiliza sua sessão
Sim
Não
Não
Esforço de configuração
Baixo
Médio
Alto
Ideal para
Sites dinâmicos, listas rápidas
Alimentos estruturados
trabalhos em lote grandes
A extração de dados de API é considerada segura quando um provedor expõe um endpoint, como o API do Google Places, Mas você paga por chamada e deve respeitar os termos e limites. A raspagem do lado do servidor é escalável para grandes lotes de trabalho, mas apresenta dificuldades com páginas que só se carregam em um navegador real. A raspagem baseada em navegador preenche essa lacuna para páginas dinâmicas e vinculadas à sessão, praticamente sem necessidade de configuração. Para uma análise mais detalhada, leia Extensão do Chrome versus raspagem de API..
O objetivo principal da extração de dados baseada em navegador é o tempo. Ela lê a página.
O navegador lê a página depois O JavaScript termina de ser executado, então ele vê as mesmas empresas, avaliações e números de telefone que um humano vê. É por isso que ele se encaixa no Google Maps, onde os resultados só existem depois que o mapa os desenha.
Por que isso é adequado para o Google Maps
A ferramenta certa para um mapa dinâmico
O Google Maps é um exemplo clássico desse método. Os resultados carregam conforme você rola a página, os detalhes se expandem ao clicar e quase nada está presente na primeira resposta HTML. Uma abordagem baseada em navegador raspador de extensão do Chrome Aguarda o término da página e então lê as cartas finalizadas. Se você quiser entender o conceito de forma mais ampla, veja O que é scraping do Google Maps..
Como a extensão é executada dentro do Chrome, ela também herda as proteções e o comportamento do navegador, e é por isso que roteiros de conteúdo são a forma padrão pela qual as extensões leem os dados da página. Como em qualquer método de coleta, leia primeiro os termos da página: nosso guia sobre se É legal extrair dados do Google Maps Abrange os aspectos práticos.
Transforme um mapa renderizado em uma lista de leads
O Vonsel lê as empresas na sua tela e cria uma lista organizada e clara em segundos. Download gratuito. Sem período de teste, sem necessidade de cartão de crédito.
Eis a distinção que importa. A extração de dados baseada em navegador é a significa: É uma maneira inteligente de ler uma página dinâmica. A lista de nomes e números brutos não é o objetivo, porém. Por si só, um arquivo CSV extraído é apenas texto esperando para ser processado.
O fim é o que você faz a seguir. A Vonsel trata a captura como um ponto de entrada para um processo completo CRM mapeado. Cada empresa aparece em um mapa, e você pode enriquecê-lo com avaliações públicas, usar a Inteligência de Avaliações para identificar pontos problemáticos e gerar um e-mail com IA personalizado para cada empresa, em vez de um e-mail genérico.
Você também pode reabrir uma captura anterior e adicionar mais empresas a ela, anexar avaliações a entradas já salvas e manter um histórico de tudo o que você extraiu. Essa é a diferença entre uma lista bruta e um banco de dados contextualizado e com valor agregado, do qual você pode realmente vender.
A extração de dados baseada em navegador lê a página. A Vonsel transforma isso em um banco de dados que você pode usar para tomar decisões
Resumo rápido
Extração de dados baseada em navegador em um parágrafo
A coleta de dados baseada em navegador lê uma página após ela ser renderizada em uma aba real do navegador, usando o mesmo conteúdo que o usuário vê. Ela se destaca em sites dinâmicos e com uso intensivo de JavaScript, como o Google Maps, não requer chaves de API ou servidores e geralmente funciona como uma extensão do Chrome. É o caminho mais rápido de um mapa em tempo real para uma lista limpa, e com o Vonsel essa lista se transforma em um CRM mapeado com avaliações e inteligência de e-mail integradas.
Comece a capturar imagens a partir do seu próprio navegador
Leia o mapa, crie a lista e trabalhe com ela dentro de um CRM mapeado. Download gratuito. Sem período de teste, sem necessidade de cartão de crédito. Explore as funcionalidades ou navegue pelo Guias de banco de dados..
A extração de dados baseada em navegador é um método que lê dados de uma página da web depois que ela é totalmente carregada em uma aba real do navegador. Em vez de chamar um servidor ou uma API, a ferramenta lê o mesmo conteúdo renderizado que você vê na tela, funcionando, portanto, com páginas dinâmicas como o Google Maps, que geram seu conteúdo com JavaScript.
Qual a diferença entre a extração de dados via navegador e a extração de dados via API?
A extração de dados via API solicita dados estruturados de um endpoint remoto e geralmente requer chaves, créditos e limites de taxa. A extração de dados baseada em navegador lê a página que seu navegador já renderizou em sua própria máquina, usando sua sessão normal. Ela lida com páginas que utilizam muito JavaScript sem a necessidade de um backend separado ou contrato de API.
A extração de dados baseada em navegador é benéfica para o Google Maps?
Sim. O Google Maps gera seus resultados dinamicamente no navegador, então uma extensão do Chrome pode ler nomes de empresas, endereços, números de telefone e avaliações diretamente da página renderizada. A Vonsel usa essa abordagem para capturar leads e enviá-los para um CRM mapeado.