Extrator de URLs do Site

Extraia todas as URLs de qualquer website. Perfeito para mapeamento de sites, auditoria de conteúdo e análise SEO abrangente.

O que é Extrator de URLs do Site?

O humberto.ai Extrator de URLs do Site rastreia um site a partir de uma URL inicial e lista todos os links internos encontrados, seguindo a estrutura de páginas até a profundidade escolhida. A URL e os parâmetros de rastreamento são enviados a um servidor que faz o crawl e devolve a lista de links — nada é salvo, você só copia ou baixa o resultado em .txt.

Como usar

  1. Informe a URL completa do site, com protocolo (https://exemplo.com).
  2. Defina o máximo de URLs a extrair (1–1000, padrão 50) e a profundidade de rastreamento (1–10, padrão 1).
  3. Opcionalmente, liste caminhos para incluir ou excluir, um por linha, para filtrar o resultado.
  4. Clique em "Extrair URLs" — o servidor do humberto.ai rastreia o site a partir da página inicial e segue os links internos até o limite definido.
  5. Copie a lista com um clique ou baixe como extracted-urls.txt.

Perguntas frequentes

Os dados do site ficam salvos em algum lugar?

Não. A URL informada e as opções de rastreamento (máximo de URLs, profundidade, caminhos) são enviadas ao servidor do humberto.ai só para executar o crawl; o resultado aparece na tela e você decide se copia ou baixa como .txt — nada fica armazenado depois.

Por que algumas URLs do site não aparecem na lista?

O extrator lê apenas os links <a href> presentes no HTML bruto retornado por cada página, sem executar JavaScript. Se o site for uma SPA que gera links dinamicamente, esses links podem não ser capturados. Páginas que não respondem em até 10 segundos ou que não retornam content-type text/html também são ignoradas.

Qual o limite de URLs e de profundidade de rastreamento?

O máximo de URLs vai de 1 a 1000 (padrão 50) e a profundidade de rastreamento vai de 1 a 10 níveis (padrão 1) a partir da URL inicial. Ambos os campos são obrigatórios e validados antes do envio.

Para que servem os campos "Caminhos para Incluir" e "Caminhos para Excluir"?

São filtros opcionais, um caminho por linha (ex.: /blog/). "Incluir" mantém só URLs cujo caminho contenha um dos termos listados; "Excluir" descarta URLs cujo caminho contenha algum dos termos — útil para pular áreas como /admin/ ou /api/.

O extrator rastreia páginas de outros domínios ou subdomínios?

Não. Apenas URLs com o mesmo hostname da URL inicial são consideradas; links para outros domínios ou subdomínios são descartados automaticamente. Ele também não consulta o robots.txt do site, então use apenas em sites que você tem permissão para rastrear.

Por que recebo "Falha na extração"?

Geralmente porque a URL é inválida, o site bloqueou a requisição do rastreador, a página não respondeu dentro de 10 segundos ou o conteúdo não é HTML. Confira se a URL começa com http:// ou https:// e se o site está acessível publicamente.

Ferramentas relacionadas