Blog

Blog

Meta robots: o guia de noindex, nofollow e X-Robots-Tag

A meta tag robots e o cabeçalho HTTP X-Robots-Tag controlam se uma página entra no índice do Google e como ela aparece nos resultados. A meta robots é uma linha no <head> do HTML, com diretivas como noindex e nofollow. O X-Robots-Tag faz o mesmo, mas pela resposta do servidor, o que permite controlar arquivos não HTML como PDFs e imagens. Os dois controlam indexação e exibição, e não devem ser confundidos com o robots.txt, que controla o rastreamento.

O que é a meta tag robots

A meta tag robots é um elemento HTML no <head> da página que diz aos buscadores se podem indexar aquela página e seguir seus links. Ela usa o atributo name="robots" para se dirigir a todos os rastreadores e o atributo content para listar as diretivas, separadas por vírgula. A forma mais comum pede para não indexar e não seguir links:

<meta name="robots" content="noindex, nofollow">

Sem nenhuma meta robots, o comportamento padrão é indexar e seguir links, o mesmo que declarar content="all". Para se dirigir a um rastreador específico em vez de a todos, é preciso especificar o nome do agente. Para falar só com o Google, use name="googlebot" em vez de "robots". Os valores de name e content não diferenciam maiúsculas de minúsculas. O padrão do Google é ler a meta robots no <head>, embora ele também respeite a tag no corpo do documento. A meta robots é uma entre as várias meta tags do cabeçalho HTML, e a única cuja função é controlar indexação e exibição.

Relatório de páginas excluídas pela tag noindex no google search console
Relatório de páginas excluídas pela tag noindex no google search console

O que é o X-Robots-Tag

O X-Robots-Tag é um cabeçalho da resposta HTTP que aplica as mesmas diretivas da meta robots, mas fora do HTML. Qualquer regra válida na meta tag também vale no X-Robots-Tag. A vantagem é o alcance: como vem do servidor, ele controla a indexação de arquivos que não têm <head>, como PDFs, imagens e vídeos, e pode ser aplicado em escala por tipo de arquivo ou por padrão de URL. Um cabeçalho que impede a indexação de uma página é assim:

X-Robots-Tag: noindex

O Google recomenda o X-Robots-Tag justamente para bloquear a indexação de recursos não HTML, onde a meta tag é impossível de inserir. Você pode combinar vários cabeçalhos X-Robots-Tag na mesma resposta ou usar uma lista separada por vírgula, e também direcionar um agente específico, como em X-Robots-Tag: googlebot: noindex.

Qual a diferença entre robots.txt e meta robots

O robots.txt controla o rastreamento, enquanto a meta robots e o X-Robots-Tag controlam a indexação. O robots.txt diz se o robô pode acessar a URL, a meta robots diz se a página, uma vez acessada, pode entrar no índice e como pode ser exibida. Essa é uma confusão frequente, a ponto de o próprio Google reforçar em sua documentação que o noindex só é lido se a página não estiver bloqueada no robots.txt. São camadas diferentes, e uma não substitui a outra.

Se a URL está desautorizada no robots.txt, o Google não rastreia o HTML e nunca lê o noindex dentro dele. Pior, uma página bloqueada no robots.txt ainda pode aparecer no índice sem descrição caso outros sites apontem para ela. Declarar noindex no próprio robots.txt também não resolve, porque essa regra não é suportada pelo Google. Se você já configurou o arquivo de rastreamento, confira o guia completo de robots.txt antes de decidir onde aplicar cada controle.

Relatório de páginas não indexadas por robots.txt e noindex no google search console
Relatório de páginas não indexadas por robots.txt e noindex no google search console

Quais diretivas existem e o que cada uma faz

As diretivas de indexação e exibição podem ser combinadas em uma lista separada por vírgula e valem tanto na meta robots quanto no X-Robots-Tag. A tabela abaixo reúne as principais regras suportadas pelo Google.

DiretivaO que faz
allPadrão: indexa e segue links, sem restrição de exibição
noindexRemove a página do índice de busca
nofollowNão segue os links da página
noneEquivale a noindex, nofollow
noarchiveNão exibe cópia em cache da página
nosnippetNão exibe trecho de texto nem vídeo, e também atua como noarchive
max-snippet:[n]Limita o trecho de texto a n caracteres (0 desliga, -1 sem limite)
max-image-preview:[valor]Tamanho máximo da prévia de imagem: none, standard ou large
max-video-preview:[n]Limita a prévia de vídeo a n segundos (0 desliga, -1 sem limite)
noimageindexNão indexa as imagens da página
notranslateNão oferece tradução da página nos resultados
indexifembeddedPermite indexar o conteúdo quando ele é incorporado em outra página via iframe, mesmo com noindex
unavailable_after:[data]Deixa de indexar a página após a data e hora informadas

Quando duas diretivas entram em conflito, o Google aplica a mais restritiva. Por exemplo, se a página tiver max-snippet:50 e nosnippet ao mesmo tempo, o nosnippet prevalece.

Essas diretivas são um padrão de fato, não uma especificação oficial, e valem apenas para os rastreadores que cooperam. O Google e o Bing honram o mesmo conjunto, com pequenas diferenças de vocabulário: o Bing mantém o nocache como sinônimo de noarchive e ainda exibe cópia em cache, recurso que o Google aposentou. Por compatibilidade, prefira escrever noindex, nofollow por extenso em vez do atalho none, que nem todos os buscadores interpretam.

Meta robots ou X-Robots-Tag: qual usar

Use a meta robots para páginas HTML que você edita e o X-Robots-Tag para arquivos não HTML ou para regras aplicadas em escala. As duas têm o mesmo efeito sobre uma página HTML, então a escolha é de conveniência e de tipo de conteúdo.

SituaçãoRecomendadoPor quê
Página HTML que você editaMeta robotsBasta uma linha no <head>, sem mexer no servidor
PDF, imagem ou vídeoX-Robots-TagEsses arquivos não têm <head> para receber a meta tag
Regra para um site ou diretório inteiroX-Robots-TagDefinida no servidor, aplica-se globalmente por padrão de URL
Sem acesso à configuração do servidorMeta robotsPermite controle página a página no próprio HTML

Como aplicar

A aplicação depende do tipo de conteúdo, e os snippets abaixo cobrem os casos mais comuns. Para uma página HTML, insira a meta tag no <head>:

<meta name="robots" content="noindex, nofollow">

Para bloquear a indexação de todos os PDFs de um site via X-Robots-Tag no Apache, adicione ao arquivo .htaccess ou httpd.conf:

<Files ~ "\.pdf$">
  Header set X-Robots-Tag "noindex, nofollow"
</Files>

O mesmo bloqueio no Nginx, no arquivo de configuração do site:

location ~* \.pdf$ {
  add_header X-Robots-Tag "noindex, nofollow";
}

Para direcionar apenas o rastreador do Google e deixar os demais livres, nomeie o agente no cabeçalho:

X-Robots-Tag: googlebot: noindex

Outros buscadores e rastreadores de IA respeitam a meta robots?

Os principais respeitam, mas cada operador decide o que honra, e nos rastreadores de IA a lógica é diferente. Como a meta robots virou norma pelo uso disseminado, não porque uma autoridade oficial a definiu e tornou obrigatória, só rastreadores cooperativos seguem as regras, e a interpretação varia entre eles.

O Bing honra a meta robots e o X-Robots-Tag. Adicionar <meta name="robots" content="noindex"> remove a página do índice do Bing depois que o Bingbot rastreia a página de novo, e o X-Robots-Tag: noindex cobre arquivos não HTML, exatamente como no Google. Para aplicar a diretiva exclusivamente ao Bing, deixando os outros buscadores livres, a regra é <meta name="bingbot" content="noindex">.

No ChatGPT, o controle é feito sobretudo pelo robots.txt, com tokens de user agent separados: OAI-SearchBot para a busca, GPTBot para o treino dos modelos e ChatGPT-User para acessos disparados pelo usuário. Não existe uma diretiva de meta robots por produto, do tipo <meta name="gptbot">. O crawler de busca da OpenAI, porém, honra o noindex: segundo a documentação de publishers deles, se a OpenAI descobre a URL de uma página por outra fonte e a considera relevante, pode exibir só o link e o título, e a forma de impedir isso é a meta tag noindex, que o rastreador só consegue ler se tiver permissão para rastrear a página. A distinção entre rastreio e indexação vale para a IA também.

Para o treino de modelos, o Google-Extended (usado pelo Gemini) e o GPTBot são tokens de robots.txt, não de meta robots. Não há um equivalente na meta tag para dizer "não use no treino", então esse controle mora no arquivo de rastreamento, não no <head>.

Erros comuns que quebram a indexação

Os erros mais frequentes vêm de misturar rastreamento e indexação. O clássico é bloquear no robots.txt uma página que precisa sair do índice: o robô não rastreia, não lê o noindex e a página continua indexada. Outro é aplicar noindex numa página importante por engano, ou herdar diretivas conflitantes de um plugin de SEO somadas a regras no servidor. Vale também lembrar que noindex e disallow no robots.txt não são sinônimos, e usar um no lugar do outro produz o efeito oposto ao esperado.

Para diagnosticar, o Google Search Console mostra na cobertura por que uma URL foi excluída, incluindo o motivo "Excluída pela tag noindex". Antes de publicar, dá para conferir a diretiva de uma página específica com uma ferramenta de auditoria on-page, como o SEO Check do site, que sinaliza a presença de noindex e outras regras de indexação. Confira também se as URLs que você quer indexar estão no seu sitemap XML, já que pedir indexação e sinalizar noindex ao mesmo tempo é uma contradição comum.

Relatório de rastreamento de página bloqueada pelo noindex no Google Search Console
Relatório de rastreamento de uma página bloqueada pelo noindex no Google Search Console

Perguntas frequentes

Qual a diferença entre noindex e nofollow?

O noindex impede que a página entre no índice de busca, enquanto o nofollow diz para o rastreador não seguir os links daquela página. São controles independentes: uma página pode ter noindex e ainda assim ter seus links seguidos, ou o contrário. A combinação noindex, nofollow faz as duas coisas ao mesmo tempo.

noindex no robots.txt funciona?

Não. Declarar noindex dentro do robots.txt não é suportado pelo Google. O robots.txt controla apenas o rastreamento, então o noindex precisa vir da meta robots ou do cabeçalho X-Robots-Tag, em uma página que o robô consiga rastrear.

Como faço noindex em um PDF?

Use o cabeçalho X-Robots-Tag na resposta do servidor, já que um PDF não tem <head> para receber a meta tag. No Apache ou no Nginx, você configura o servidor para enviar X-Robots-Tag: noindex nos arquivos com extensão .pdf, como nos exemplos da seção prática.

O que acontece com diretivas conflitantes?

Quando há regras conflitantes, o Google aplica a mais restritiva. Se uma página tiver max-snippet:50 e nosnippet juntas, o nosnippet vence e nenhum trecho é exibido. Por isso vale revisar diretivas herdadas de plugins e de configurações do servidor antes de publicar.

A meta robots precisa ficar no head?

O padrão é colocar a meta robots no <head>, e é a prática recomendada. Na prática, o Google também respeita a tag quando ela aparece no corpo do documento, mas manter no <head> evita ambiguidade e facilita a manutenção.

Quem respeita a meta robots?

O Google e o Bing honram a meta robots e o X-Robots-Tag e o crawler de busca da OpenAI respeita o noindex para não exibir a página no ChatGPT. Cada rastreador decide o que honra, e scrapers não cooperativos podem ignorar tudo. Já o uso do conteúdo em treino de IA, como no Gemini e no GPT, se controla pelo robots.txt, não pela meta robots.

Próximo passo

A meta robots, o X-Robots-Tag e o robots.txt formam o trio de controle de indexação e rastreamento: o robots.txt decide o acesso, a meta robots e o X-Robots-Tag decidem o índice e a exibição. Depois de definir onde aplicar cada um, o passo seguinte é garantir que as páginas que você quer no índice estejam consistentes entre robots.txt, sitemap e canonical, sem sinais contraditórios entre elas.

Continue lendo

SEO Técnico Meta tags HTML: o guia completo 11 min de leitura SEO Técnico O que é canonical e para que serve a tag rel=canonical 11 min de leitura