Testador de robots.txt online
O Testador de robots.txt busca o arquivo de qualquer domínio e responde se uma URL específica está liberada ou bloqueada para o user-agent que você escolher, mostrando qual regra decidiu o resultado. Ele funciona em site de terceiro, o que a Inspeção de URL do Search Console não faz, e aceita crawlers de IA como GPTBot e ClaudeBot além do Googlebot.
Conteúdo do robots.txt
A busca é feita pelo servidor do site, assim o navegador não bloqueia por CORS.
Testar uma URL contra estas regras
Como testar uma URL no robots.txt
São três passos: carregar o arquivo, informar a URL e escolher o user-agent.
- Carregue o
robots.txtpor uma das três abas. Em Link, informe o endereço do arquivo, comohttps://exemplo.com/robots.txt, e a busca é feita pelo servidor deste site, não pelo seu navegador. Em Texto, cole o conteúdo. Em Arquivo, envie o arquivo do seu computador. - Clique em Validar. A ferramenta lista os grupos, as regras de cada um, os sitemaps declarados e os problemas encontrados, com o número da linha.
- No bloco de teste que aparece abaixo do relatório, informe a URL ou só o caminho, escolha o user-agent e clique em Testar. O campo aceita qualquer nome de bot, e o menu sugere os mais usados.
O teste roda sobre o conteúdo que está na tela, não sobre o arquivo publicado. É isso que permite editar o texto colado, testar de novo e ver o efeito da mudança antes de subir qualquer coisa.
Como ler o resultado do teste
O veredito vem em duas partes: liberado ou bloqueado, e a regra que decidiu, com o número da linha onde ela está.
A segunda parte é a que resolve o problema na prática, porque um caminho quase sempre casa com mais de uma regra e só uma delas vale. Esta é a tabela do que cada resposta significa.
| O que a ferramenta responde | O que significa | O que fazer |
|---|---|---|
| PERMITIDO, com uma regra citada | Uma regra Allow venceu a disputa com as demais que casavam com o caminho. |
Nada. Se você esperava bloqueio, veja a seção sobre a regra vencedora. |
| PERMITIDO, sem regra citada | Nenhuma regra do grupo casou com o caminho, e o padrão do protocolo é liberar. | Se a intenção era bloquear, falta a regra: o arquivo não cobre esse caminho. |
| PERMITIDO com aviso de que nenhum grupo se aplica | O user-agent testado não casa com nenhum grupo do arquivo, nem existe um grupo *. |
Confira se o bot que interessa precisa de grupo próprio ou de um grupo curinga. |
| BLOQUEADO, com uma regra citada | Uma regra Disallow venceu, e o bot testado não deve buscar essa URL. |
Se o bloqueio não era intencional, ajuste a regra da linha indicada. |
| Erro na linha X | A linha não tem o formato campo: valor, ou traz um campo obrigatório vazio. |
Corrija a linha. Regras quebradas são descartadas, e o bloqueio que você esperava não acontece. |
| Aviso de diretiva não reconhecida | O campo daquela linha não faz parte do vocabulário que os crawlers leem. | Erro de digitação é a causa comum. A linha é ignorada, então ela não protege nada. |
| O servidor de destino respondeu 404 | Não existe robots.txt nesse endereço. |
Sem arquivo, o rastreamento é liberado por padrão. Confira se o endereço está certo antes de concluir. |
| O servidor de destino respondeu 500 ou 503 | O arquivo existe mas o servidor falhou ao entregá-lo. | É o caso mais perigoso: erro de servidor no robots.txt costuma ser tratado como bloqueio total temporário. Trate como incidente. |
Por que a regra vencedora não é a que você esperava
Quando o resultado surpreende, quase sempre é porque a disputa foi decidida pela regra mais específica, e não pela que aparece primeiro no arquivo.
A ferramenta mostra qual regra venceu justamente para tornar isso visível. A ordem das linhas não importa: entre todas as regras do grupo que casam com o caminho, vale a de padrão mais longo, e no empate o Allow ganha do Disallow. Por isso um Allow curto perde para um Disallow mais detalhado, e um Allow apontando para uma subpasta específica libera aquele trecho mesmo dentro de um Disallow amplo acima dele.
A escolha do grupo segue a mesma lógica, um nível antes: o teste usa o grupo cujo nome de user-agent é o mais longo contido no bot informado, e só cai no grupo * quando nenhum outro casa. É por isso que testar Googlebot-Image e Googlebot no mesmo arquivo pode devolver respostas diferentes. Para a sintaxe completa das diretivas, o pilar sobre robots.txt cobre cada uma delas.
O que o testador não verifica
Ele responde sobre rastreamento, e só.
O teste não diz se a página está indexada, porque isso é outra etapa e depende de fatores que o arquivo não controla. Ele também não lê a meta tag robots nem o cabeçalho X-Robots-Tag da página de destino, que são os controles de indexação de verdade, tratados em meta robots.
E há o limite óbvio: o arquivo é um pedido, não uma cerca. Um veredito BLOQUEADO diz que um bot que respeita o protocolo não deveria buscar aquela URL, não que ele fisicamente não consegue. Para entender o que acontece depois do rastreamento, o pilar sobre rastreamento segue o caminho até a indexação.
Quando vale testar o robots.txt de outro site
Sempre que você não tiver propriedade verificada no Search Console daquele domínio, que é a condição para usar as ferramentas do Google.
- Antes de subir para produção: cole o arquivo novo, teste as URLs que não podem quebrar e só então publique.
- Em auditoria de cliente: dá para diagnosticar o bloqueio na primeira reunião, sem esperar o acesso ao Search Console dele.
- Em concorrente: o arquivo é público e revela quais áreas o site prefere manter fora da busca.
- Para descobrir se você bloqueou robôs de IA sem saber: teste a mesma URL com
GPTBot,ClaudeBotePerplexityBot. Plugin de SEO e configuração de CDN às vezes adicionam esses bloqueios por padrão. O tema está em site rastreável por IAs.
Por que o testador de robots.txt saiu do Search Console
O Google aposentou o testador antigo no fim de 2023 e colocou no lugar um relatório de robots.txt, que resolve outro problema.
O relatório mostra quais arquivos o Google encontrou nos principais hosts da sua propriedade, quando cada um foi rastreado e que erros apareceram. É útil para saber o que o Google leu, e é isso que ele faz.
Duas limitações explicam por que uma ferramenta como esta continua fazendo falta. A primeira: o relatório só existe para propriedade verificada no Search Console, então ele não responde nada sobre um domínio que não é seu. A segunda: para testar uma URL específica, a documentação do Google encaminha para a Inspeção de URL, que também exige propriedade verificada e responde pelo Googlebot, não pelo bot que você escolher. Testar o arquivo de um terceiro, ou testar com GPTBot, fica fora dos dois caminhos.
Perguntas frequentes sobre o testador de robots.txt
- Posso testar o robots.txt de um site que não é meu?
- Pode, e é a principal razão de a ferramenta existir. Informe o endereço do arquivo na aba Link e o servidor deste site faz a busca. Não é preciso ter acesso ao Search Console do domínio, nem propriedade verificada, nem permissão de ninguém: o arquivo é público por definição do protocolo.
- Dá para testar um robots.txt que ainda não subiu?
- Dá. Cole o conteúdo na aba Texto, ou envie o arquivo na aba Arquivo, e teste as URLs contra ele. Como a validação e o teste rodam sobre o texto que está na tela, você pode editar, testar de novo e só publicar quando o resultado for o esperado.
- O teste vale para outros buscadores além do Google?
- O casamento de regras segue o RFC 9309, que é o padrão que Google e Bing implementam, então o resultado vale para os dois. Fora disso, cada crawler decide o quanto obedece. Um detalhe conhecido: o
Crawl-delayé ignorado pelo Googlebot e respeitado por outros, e a ferramenta avisa quando encontra essa diretiva. - Por que o resultado da ferramenta é diferente do que o Search Console mostra?
- Porque as duas leituras respondem a perguntas diferentes. Esta ferramenta avalia o conteúdo que você carregou agora, com o user-agent que você escolheu. O Search Console reporta o que o Googlebot encontrou na última vez que buscou o arquivo, que pode ser uma versão anterior à sua edição, e sempre pelo ponto de vista do Googlebot.
- Quanto tempo depois de editar o arquivo o teste reflete a mudança?
- Aqui, imediatamente: basta carregar o arquivo de novo pela aba Link. O que demora é o Google atualizar a versão dele, porque o
robots.txté armazenado em cache por um tempo, e é por isso que o relatório do Search Console pode continuar mostrando o conteúdo antigo depois de você ter publicado o novo. - O que significa quando a ferramenta diz que o arquivo não foi encontrado?
- Significa que o endereço respondeu 404. Confira antes de tudo se o endereço está correto, porque o arquivo precisa estar na raiz do host, e um host diferente tem outro arquivo. Confirmado o 404, a leitura é: não existe
robots.txtali, e o rastreamento fica liberado por padrão, o que é bem diferente de um arquivo que responde erro de servidor.
Veja também
Depois de liberar o rastreamento, confira se as URLs estão declaradas com o Validador de sitemap, ou audite a página inteira com o SEO Check.