Gerador de robots.txt

Monte seu robots.txt bloco a bloco: regras Allow e Disallow por robô, crawl delay, sitemaps e comentários, com prévia ao vivo.

O arquivo é montado localmente no seu navegador. Nada sai do seu dispositivo.

Sitemaps

Uma linha «Sitemap:» por sitemap XML — URL absoluta completa é a escolha segura.

Prévia do robots.txt
—

Partindo de um arquivo existente? Cole as linhas nos blocos manualmente — a prévia substitui o arquivo antigo ao final.

Como funciona

A ferramenta percorre seus blocos de regras de cima para baixo e grava um grupo User-agent: por bloco: primeiro a linha do agente, depois cada Allow:, Disallow: e o Crawl-delay: opcional, seguidos pelas linhas Sitemap: e pelos comentários que você adicionar. A prévia atualiza enquanto você digita e, ao copiar ou baixar, você recebe um arquivo pronto para a raiz do site em /robots.txt.

Ordem das diretivas e a correspondência mais específica
O robô procura o grupo cujo User-agent: ele casa; se vários casarem, o Google usa o mais específico (um grupo Googlebot-news vence um com *). Dentro do grupo ganha o path mais longo que casar, então Allow: /privado/parte-publica pode abrir uma exceção dentro de Disallow: /privado. A ordem não cria prioridade — a especificidade cria.
Disallow: / contra Disallow: (vazio)
Disallow: / bloqueia o site inteiro para aquele agente. Um valor vazio, Disallow:, significa o oposto: rastreie tudo. Um grupo sem nenhuma linha Disallow se comporta como o vazio, e é por isso que o bloco inicial da ferramenta já traz uma linha Disallow em branco.
Curingas, âncoras finais e por que isso não é segurança
Google e Bing estendem a sintaxe com * casando qualquer caractere e $ ancorando o fim, então Disallow: /*.pdf$ pula todos os paths de PDF. Lembre do limite: o robots.txt é um protocolo de cortesia que os buscadores honram, nada o impõe — e o arquivo é público, então uma linha Disallow anuncia exatamente o que você queria esconder. Paths sensíveis pedem autenticação, não diretivas.

Perguntas frequentes

Uma URL bloqueada some do Google?

Não necessariamente. O Disallow impede que o Google rastreie a página, mas se outros sites apontarem para aquela URL o Google pode continuá-la listando nos resultados — em geral com o título, o aviso "URL bloqueada pelo robots.txt" e sem descrição. Para remover uma página de verdade é preciso que ela fique acessível e sirva uma meta tag noindex (ou resposta 410/401 autenticada); aí o robots.txt pode mantê-la fora.

O robots.txt é melhor que o noindex para esconder páginas?

Normalmente é o contrário. O Google já afirmou que bloquear via robots.txt é o método mais fraco de desindexação: uma página bloqueada no rastreio pode continuar no índice, e o Google não enxerga a tag noindex de uma página que não pode baixar. A ordem confiável é: deixar o robô entrar, servir noindex (meta ou cabeçalho HTTP) e só então adicionar o Disallow, quando a página já saiu do índice.

A linha Sitemap: é obrigatória?

Não — o Search Console e os feeds podem descobrir os sitemaps de outras formas —, mas é a autodescrição mais barata que um site pode oferecer: uma linha grátis dizendo a cada robô certificado onde ficam seus sitemaps XML. Inclua pelo menos a URL canônica do sitemap principal.

O robots.txt protege páginas privadas ou o painel de administração?

Não, e contar com isso é um erro clássico. O robots.txt fica em uma URL pública, então publicar um Disallow equivale a distribuir a lista dos seus caminhos escondidos: Google e Bing indexam o próprio arquivo, e raspadores o leem todo dia. O que é secreto fica atrás de autenticação, não atrás de uma diretiva que robôs educados concordam em seguir.

Algo é enviado para um servidor?

Não. O arquivo é montado com JavaScript puro a partir do que você digita, e copiar e baixar acontecem inteiramente no seu navegador — dá até para gerar off-line. Nada sai do seu dispositivo, a menos que você mesmo publique o resultado no seu site.