Crawler: Definição e funcionamento dos bots da Web

Um crawler é um programa automatizado que visita sistematicamente páginas da Web, segue links e armazena conteúdos para uma análise posterior. O exemplo mais conhecido é o Googlebot, mas há já muito que existem também crawlers baseados em IA que operam com objetivos totalmente diferentes. Quem pretenda que uma página seja rastreada deve compreender como estes bots funcionam do ponto de vista técnico e de que fatores depende a frequência das suas visitas, pois sem esta base, qualquer otimização adicional ficará superficial.

Como funciona um crawler

Um rastreador começa normalmente com uma lista de URLs conhecidas e descarrega o seu código-fonte. A partir desse código, extrai novos links e coloca-os numa lista de espera para a próxima visita, criando-se assim, com o tempo, um enorme mapa da Web em constante crescimento. Este mapa constitui a base para praticamente todos os passos seguintes, desde o índice de pesquisa até ferramentas de análise específicas e serviços de monitorização.

Dica: Um mapa do site em XML acelera consideravelmente este processo, pois fornece ao rastreador todos os URLs importantes num só lugar, em vez de este ter de os descobrir através de links individuais.

Este ciclo de carregamento, análise e acompanhamento decorre 24 horas por dia e em grande escala, na maioria das vezes distribuído por milhares de servidores em simultâneo. Mesmo os sites mais pequenos são visitados várias vezes por dia, muitas vezes sem que os administradores se apercebam disso, desde que não surjam problemas como uma atualização repentina do algoritmo. Só ao consultar os registos do servidor é que este tráfego constante de bots se torna realmente visível, na maioria das vezes numa escala que surpreende muitos administradores à primeira vista.

  • Início através de listas de URLs conhecidas
  • O código-fonte está a ser lido
  • Os novos links são colocados na lista de espera
  • O processo decorre de forma contínua e em paralelo
Solicite uma análise gratuita do potencial da sua empresa
Solicitar agora

Tipos de rastreadores

Para além dos rastreadores dos motores de busca, existem rastreadores de ferramentas de SEO que verificam especificamente uma única página em busca de erros, bem como bots de comparação de preços e de arquivo. Cada tipo tem um objetivo próprio, embora a tecnologia subjacente seja semelhante. A isto juntam-se agora os rastreadores de IA, que recolhem conteúdos para modelos de linguagem em vez de para um índice de pesquisa clássico, o que faz com que as fronteiras entre as categorias se tornem cada vez mais difusas. Para os operadores, torna-se assim mais difícil distinguir claramente cada tipo de bot.

  • Rastreadores de motores de busca para o índice
  • Ferramentas de SEO para verificação de erros
  • Portais de preços e comparação
  • Bots de arquivo para a história da Web

Dirigir e controlar os veículos sobre esteiras

Através do ficheiro robots.txt, é possível definir quais as áreas que um rastreador pode visitar. Muitas lojas excluem deliberadamente áreas importantes, como o sistema de carrinho de compras, para reduzir a carga no servidor e evitar conteúdos duplicados. A SEO técnica de um site também influencia a eficiência com que um rastreador encontra as áreas importantes e a quantidade de recursos que são desperdiçados em páginas sem importância. Uma estrutura de links internos bem planeada direciona o rastreador de forma específica para as páginas que realmente importam, sendo este um elemento central de qualquer otimização sólida de SEO on-page.

  • O ficheiro robots.txt regula o acesso
  • O mapa do site remete para páginas importantes
  • Os bloqueios reduzem a carga do servidor
  • Os registos do servidor mostram as visitas efetivas
Marcar uma reunião estratégica com a nossa equipa
Solicitar agora

Erros típicos no controlo do rastreador

É frequente que diretórios inteiros sejam bloqueados acidentalmente através do ficheiro robots.txt, por exemplo, após um relançamento ou a instalação de um novo CMS. Esses erros passam frequentemente despercebidos durante muito tempo, porque não se manifestam diretamente na aparência do site, mas sim apenas através da diminuição do número de visitantes e de relatórios vazios na Search Console. Um teste rápido, realizado imediatamente após cada alteração técnica de maior envergadura, revela geralmente esses erros de imediato, em vez de só os detetar semanas mais tarde.

  • Obstáculos após o relançamento que passaram despercebidos
  • Caminhos incorretos no ficheiro robots.txt
  • O mapa do site não está atualizado
  • Erros que só se tornam visíveis mais tarde

Compreender o orçamento de rastreamento e utilizá-lo de forma específica

Cada site recebe de um rastreador apenas uma quota limitada de atenção, frequentemente designada por «orçamento de rastreamento». O número de páginas visitadas e o período de tempo em que isso ocorre dependem da dimensão do site, do seu desempenho técnico e da frequência com que são publicados novos conteúdos. Se este orçamento for desperdiçado em páginas irrelevantes ou duplicadas, os novos conteúdos importantes permanecem por descobrir durante mais tempo do que o necessário.

Quem pretenda gerir o orçamento de forma consciente deve excluir sistematicamente as áreas menos importantes da estrutura de rastreamento e, em vez disso, criar uma hierarquia clara composta por páginas de categorias e de detalhes. Uma estrutura clara, que permita chegar à página mais importante com poucos cliques, ajuda nesse sentido, tal como um mapa do site atualizado regularmente, tal como descrito nos Conceitos Básicos das Ferramentas para Webmasters.

Mesmo parâmetros de URL aparentemente inofensivos, como os utilizados para ordenação ou rastreamento, criam constantemente, do ponto de vista de um rastreador, novas páginas tecnicamente independentes e, assim, consomem, sem que se perceba, uma parte considerável do orçamento disponível. Uma tag «canonical» definida de forma consistente redireciona a atenção para a versão principal propriamente dita e evita que as páginas duplicadas consumam recursos desnecessariamente.

  • O orçamento é, por natureza, limitado
  • As páginas sem importância desperdiçam capacidade
  • Uma hierarquia clara das páginas proporciona uma visão geral
  • O mapa do site atual redireciona de forma específica

Os registos do servidor como ferramenta para o controlo dos rastreadores

Os registos do servidor mostram exatamente quando cada rastreador visitou cada página, independentemente do que as ferramentas de análise no navegador venham a indicar posteriormente. Estes dados brutos proporcionam, assim, uma perspetiva que as ferramentas clássicas de análise da Web, por natureza, não refletem, uma vez que se concentram nos visitantes humanos, tal como descrito nos princípios básicos da análise de dados no marketing.

Vale a pena consultar regularmente estes registos, especialmente após alterações técnicas, como por exemplo após um relançamento, porque é aí que se verifica imediatamente se os rastreadores encontram novas páginas com erros ou se áreas importantes passam subitamente a ser visitadas com menos frequência. Quem negligencia esta verificação, muitas vezes só se apercebe dos problemas semanas mais tarde, ao constatar uma diminuição no número de visitantes.

Quem quiser analisar a situação com mais atenção deve verificar também se um suposto bot provém efetivamente do fornecedor indicado, pois alguns programas maliciosos fazem-se passar falsamente por um crawler conhecido para contornar bloqueios. Uma simples comparação do endereço IP com os intervalos oficiais do respetivo fornecedor permite esclarecer rapidamente esta questão.

  • Visitas de bots identificáveis com precisão no registo
  • Complementa de forma útil a análise clássica da Web
  • Particularmente importante após alterações técnicas
  • Sistema de alerta precoce para problemas de rastreamento

About the Author Chefredaktion
Stephan M. Czaja

Unternehmer, Nerd und Coder mit Liebe für Marketing, Ads, Creatives und Kampagnen. Schreibe, seit ich denken kann — über alles, was zählt.