Devo bloquear rastreadores de IA no meu site?
A resposta a essa pergunta depende do que o seu site faz. Existem pelo menos três tipos de robôs visitando o seu site em nome das inteligências artificiais, e as consequências de barrar cada um são muito diferentes. Recusar o treino tira o seu conteúdo do que o modelo sabe de cor. Recusar a busca tira o seu site do que ele consegue consultar na hora de responder (e é aí que a visibilidade some).
E no Google os dois vêm no mesmo pacote, sem meio-termo. Entenda o que significa a escolha de cada caminho, e como decidir o que bloquear ou não.
Bloquear rastreadores de IA depende do que o site faz
A decisão muda conforme o papel que o conteúdo cumpre no seu negócio. Para quem vende serviço ou produto, o conteúdo é meio: ele existe para que alguém encontre você e entre em contato. Nesse caso, aparecer nas respostas geradas por IA é a continuação natural de aparecer no Google, e bloquear isso significa desaparecer de um lugar onde as pessoas estão procurando. Para quem publica conteúdo como produto, seja um jornal, um blog monetizado por anúncios ou um autor que vive do que escreve, a conta é outra. Cada resposta gerada a partir do seu texto pode ser uma visita que não acontece, uma assinatura que não é feita, um crédito que não aparece.
O antigo contrato entre buscadores e criadores de conteúdo, em que o buscador leva o seu texto e devolve audiência, continua valendo no Google, mas não nas plataformas de IA. Pelo menos não na mesma proporção.
A diferença entre esses dois casos pode ser medida. A Cloudflare publica uma relação entre quantas páginas cada plataforma rastreia e quantas visitas ela devolve ao site de origem. Em 28 de agosto de 2026, o Google estava em 5 páginas rastreadas para cada visita devolvida. A OpenAI estava em 572 para 1. A Anthropic, em 2.700 para 1.
Metade do rastreamento de IA não separa treino de busca
Os robôs de IA não fazem todos a mesma coisa. A Cloudflare classifica o tráfego de robôs por finalidade declarada, e o retrato de seis meses até 28 de agosto de 2026 é o seguinte.
| Finalidade da varredura | Participação do tráfego de robôs de IA |
|---|---|
| Treinamento | 43,6% |
| Treinamento e pesquisa | 41,9% |
| Busca | 10,7% |
| Ação de usuário | 2,9% |
| Não declarado | 0,9% |
Fonte: Cloudflare Radar, últimos seis meses, consultado em 28/08/2026.
- Treinamento é a coleta de texto para ensinar o modelo. O conteúdo entra num conjunto de dados, é usado para ajustar o modelo e depois nunca mais precisa ser visitado. Nessa categoria estão o
Meta-ExternalAgent(31,1% de participação), oClaudeBot(30,8%), oGPTBot(23,2%) e oBytespider(13,5%), da ByteDance.
- Busca é a construção de um índice, exatamente como o Google faz há décadas. O robô visita o site, guarda uma cópia e usa essa cópia para responder quando alguém pergunta. Nessa categoria estão o
Amazonbot(54,1%), oClaude-SearchBot(21,9%) e oOAI-SearchBot(19%).
- Ação de usuário é o robô que sai para buscar uma página específica porque alguém, naquele instante, pediu. O
ChatGPT-Userresponde por 52,1% dessa fatia.
A linha que mais importa nessa tabela é a segunda. Treinamento e pesquisa é a categoria dos robôs que fazem as duas coisas com a mesma visita, sem separar. E ela é quase tão grande quanto a de treino puro. Quem está nela: Googlebot (64,8%), Bingbot (19,6%) e Applebot (15,6%). Ou seja, os buscadores tradicionais são justamente os que não oferecem portas separadas para busca e para treinamento.

Bloquear o GPTBot não tira o seu site do ChatGPT.
Pela documentação da OpenAI, o GPTBot coleta conteúdo para treinar os modelos. Mas quem decide se o seu site pode aparecer nas respostas de busca do ChatGPT é um agente diferente, o OAI-SearchBot, com configuração independente. A própria OpenAI diz que é possível liberar um e barrar o outro.
Isso importa mais do que parece porque, como mostra nossa análise sobre o que o ChatGPT lê do seu site, a maior parte das referências que o ChatGPT apresenta vem do índice interno dele, não de uma busca feita ao vivo no momento da pergunta. Quem barra o GPTBot acreditando estar saindo do ChatGPT recusou apenas o treino, mas permanece no índice, porque o índice é construído pelo OAI-SearchBot. Já quem barra o OAI-SearchBot é que sai das respostas, embora possa continuar aparecendo como link de navegação.
O mercado já percebeu a diferença, e a assimetria é grande. A Cloudflare examinou 4.365 arquivos robots.txt entre os dez mil domínios mais acessados, em 23 de agosto de 2026:
| Agente | Bloqueio total | Liberação total |
|---|---|---|
GPTBot (treino, OpenAI) | 514 domínios | 205 domínios |
ClaudeBot (treino, Anthropic) | 458 | 177 |
Google-Extended (treino, Google) | 418 | 188 |
OAI-SearchBot (busca, OpenAI) | 108 | 190 |
Googlebot (busca, Google) | 24 | 134 |
Fonte: Cloudflare Radar, atualizado em 23/08/2026.
O mercado recusa treino e mantém busca. Os dois agentes da OpenAI tem quase cinco vezes de diferença no bloqueio. E o Googlebot, com 24 bloqueios totais em 4.365 arquivos, é a prova de que praticamente ninguém quer fechar a porta do índice do Google.

No Google, treino e busca são o mesmo rastreamento
Não existe uma forma de sair apenas das respostas com IA do Google e continuar aparecendo na busca. A documentação diz que as preferências de rastreamento dirigidas ao Googlebot afetam tanto a Pesquisa Google quanto recursos como AI Overviews e AI Mode. Bloquear o Googlebot para escapar do resumo gerado por IA significa sair do índice também.
A Cloudflare mantém um quadro de boas práticas de robôs em que um dos critérios é justamente se o operador mantém agentes distintos por finalidade. OpenAI, Anthropic, Meta, Amazon e Perplexity aparecem com "sim". Google, Apple e Bing aparecem com "não".
Na OpenAI, recusar treino e permanecer visível é uma escolha documentada e trivial. No Google, essa escolha existe para o Gemini e não existe para a busca. Você pode optar por bloquear o bot Google-Extended, que é o bot usado para treinar futuras gerações dos modelos Gemini, e manter o Googlebot liberado para a busca e AI Overview. Mas quem quiser sair da camada de IA do Google estará escolhendo automaticamente sair também do maior índice de busca do mundo.
Uma troca desproporcional
Sempre houve uma troca implícita na web aberta: o buscador consome o seu texto inteiro e devolve audiência. A relação nunca foi de um para um, mas era proporcional o suficiente para valer a pena. O que muda com a IA não é a natureza da troca, é a escala dela.
| Plataforma | Páginas rastreadas por visita devolvida | Variação sobre o período anterior |
|---|---|---|
| Anthropic | 2.700 : 1 | −90,9% |
| Mistral | 2.300 : 1 | +10.300% |
| OpenAI | 572 : 1 | −46,2% |
| Perplexity | 208 : 1 | +101,6% |
| Microsoft | 33 : 1 | −7,5% |
| 5 : 1 | −12,9% | |
| DuckDuckGo | 1,8 : 1 | +38,3% |
Fonte: Cloudflare Radar, consultado em 28/08/2026. A variação compara com o período imediatamente anterior e o painel não informa se a mudança veio de menos rastreamento ou de mais referência, então ela indica a direção da tendência, não o motivo dela.
O Google devolve uma visita para cada leva 5 páginas, o que mantém a troca reconhecível. A OpenAI leva uma visita a cada 572 páginas e a Anthropic uma a cada 2.700. As empresas continuam usando seu conteúdo inteiro nos três casos, o que encolheu foi o retorno.
Há ainda uma parte da troca que não aparece em nenhuma tabela. O seu texto pode reaparecer sem crédito, ou com crédito mas fora de contexto, ou ainda distorcido a ponto de dizer algo que você não disse e ainda assim carregar o seu nome. Para quem tem o texto como produto, esse é o argumento mais forte a favor de bloquear.

Bloquear faz sentido quando não há contrapartida nenhuma
Existe um grupo pequeno de agentes que falha em todos os critérios de transparência ao mesmo tempo, e para eles o bloqueio é a resposta certa mesmo num site de postura permissiva.
O caso mais claro é o Bytespider, da ByteDance. Ele responde por 13,5% de todo o rastreamento com finalidade de treino e é o quarto agente mais bloqueado nos arquivos robots.txt examinados pela Cloudflare, com 489 bloqueios totais. No quadro de transparência da mesma empresa, a ByteDance é a única operadora marcada com "não" nos três critérios avaliados: não é verificável, não mantém agentes distintos por finalidade e não publica métricas de uso dos dados.

A ByteDance aparece na tabela da seção anterior com 8,6 páginas rastreadas por visita devolvida, um dos melhores números do conjunto, mas esse número isolado engana. O painel mede a plataforma, não o agente. Quem rastreia é o Bytespider, que recolhe material de treino. Quem devolve visitas é o TikTok, quando alguém clica num link publicado lá. São dois produtos da mesma empresa que não se comunicam, e por isso nada do que o Bytespider leva do seu site volta em forma de tráfego.
Depois dele vem uma categoria diferente, mas que não esconde o que faz: agentes que coletam dados para revender. A Webz.io opera rastreadores que classificam o material como utilizável ou não para treino de IA, e vende esses dados para terceiros. Outra empresa, a Diffbot, monta um grafo de conhecimento a partir do que rastreia do seu site e comercializa isso por assinatura. As duas descrevem seus modelos de negócio abertamente na própria documentação. Aqui o seu texto vira insumo de um produto vendido a terceiros, sem menção à origem em nenhum ponto da cadeia. Nenhuma resposta cita você, nenhum leitor chega até você, e quem compra o conjunto de dados nem sabe que você existe.
Uma lista de bloqueio deve ser curta e ter critério. Um agente merece entrar nela quando não se identifica de forma verificável, quando não separa treino de busca e quando não oferece contrapartida alguma, nem tráfego, nem citação, nem um mecanismo de recusa que funcione.
A janela para mudar de ideia está encolhendo
A busca com IA ainda é pequena, mas está crescendo rápido o suficiente para que a decisão de hoje tenha consequências daqui a pouco tempo. Três movimentos aparecem nos dados dos últimos seis meses.
O primeiro é o crescimento do rastreamento de busca. O Claude-SearchBot saiu de praticamente zero em junho de 2026 e hoje responde por 21,9% de toda a varredura com finalidade de busca. O Amazonbot cresceu de forma contínua e teve um pico acentuado em agosto. O OAI-SearchBot acompanha. Esses são os agentes que constroem índices, e um índice sendo construído hoje é a resposta que alguém vai receber amanhã.
O segundo é o uso ao vivo. No recorte de ação de usuário, o ChatGPT-User teve em agosto de 2026 o pico do período inteiro, muito acima do patamar dos meses anteriores. Esse agente só se move quando alguém, de fato, faz uma pergunta que exige buscar uma página.
O terceiro é a proporção de gente. No painel de tipos de cliente, a fatia humana das solicitações de HTML caiu de algo em torno de 46% em março para algo em torno de 38% no fim de agosto. A web está sendo consumida cada vez mais por máquinas e cada vez menos por pessoas
Nada disso diz que a busca tradicional acabou. Diz, sim, que a camada de IA está deixando de ser experimento. Bloquear agora é rápido de fazer e rápido de desfazer. Desfazer um bloqueio leva cerca de 24 horas, segundo a OpenAI, que é o prazo para uma mudança no robots.txt refletir na busca. Já recuperar a posição perdida leva outro tempo, que depende de cada plataforma voltar a rastrear o seu site, e isso não tem prazo documentado..
Eessa reversibilidade é fácil enquanto os índices ainda estão se formando. Quanto mais consolidados, mais lenta a volta.
Como decidir
A decisão fica mais simples quando você para de perguntar se bloqueia IA e passa a perguntar o que cada tipo de robô custa no seu caso.
| Tipo de site | Treino | Busca e leitura ao vivo |
|---|---|---|
| Presta serviço, quer ser encontrado | Indiferente | Liberar |
| Vende produto | Indiferente | Liberar |
| Vive de audiência e anúncio | Bloquear | Liberar |
| Vive de assinatura ou conteúdo pago | Bloquear | Liberar o aberto, avaliar o restrito |
| Documentação e apoio a cliente | Liberar | Liberar |
A regra por trás da tabela é curta. Bloquear o treino tira o seu conteúdo do que os modelos sabem de cor e mantém intacta a sua presença nos índices. Bloquear a busca e a leitura ao vivo faz o oposto, o seu conteúdo continua no que os modelos aprenderam mas o seu site sai das respostas, que é o que poderia gerar algum tráfego para seu site. Nas duas primeiras linhas, recusar o treino não altera nada de prático, e a decisão passa a ser sobre postura.
Antes de decidir que a IA não traz nada, verifique quanto ela já traz: o canal AI Assistant do GA4 separa as visitas vindas de assistentes das demais, e os registros do servidor mostram quais agentes estão de fato passando pelo seu site e com que frequência.
A adoção de padrões emergentes ainda é marginal: entre 111.364 domínios verificados pela Cloudflare em 23 de agosto de 2026, 84% têm robots.txt e 81% têm regras específicas para IA nele, enquanto o padrão de sinais de conteúdo aparece em 8,1% e os protocolos mais recentes ficam abaixo de 1%. O arquivo de sempre continua sendo o instrumento real, o que reforça o argumento de por que você não precisa de llms.txt. Para entender por baixo como esses robôs chegam até você, vale ler como o Google rastreia seu site.
Perguntas frequentes
Bloquear o GPTBot tira meu site do ChatGPT?
Não. O GPTBot coleta conteúdo para treinar os modelos da OpenAI. Quem determina se o seu site aparece nas respostas de busca do ChatGPT é o OAI-SearchBot, que tem configuração independente. Bloquear o GPTBot recusa o treino e mantém a visibilidade.
Bloquear rastreadores de IA prejudica meu ranqueamento no Google?
Depende do token. O Google-Extended não afeta a inclusão na Pesquisa nem é sinal de classificação, segundo a documentação do Google, então bloqueá-lo é seguro. Já o Googlebot afeta a Pesquisa e todos os seus recursos, incluindo AI Overviews e AI Mode, e bloqueá-lo significa sair do índice.
Os robôs de IA são obrigados a obedecer o robots.txt?
Não existe obrigação técnica. O arquivo é um pedido que o robô pode ignorar, e alguns ignoram. A própria OpenAI observa que as regras do robots.txt podem não se aplicar ao ChatGPT-User, porque a visita é acionada por uma pessoa. Para agentes que não respeitam a diretiva, o bloqueio precisa acontecer na camada de rede.
Dá para voltar atrás depois de bloquear?
Sim, e é rápido. A OpenAI informa que uma alteração no robots.txt leva cerca de 24 horas para ser refletida na busca dela. O que não volta rápido é a posição perdida enquanto o site esteve fora, já que os índices se reconstroem no ritmo de rastreamento de cada plataforma.
Como saber se estou recebendo visitas vindas de IA?
Por duas vias complementares. Os registros do servidor mostram quais agentes visitaram o site, com que frequência e em quais páginas, que é o lado do rastreamento. As ferramentas de análise mostram as visitas de pessoas que chegaram a partir de um assistente, que é o lado do retorno. Comparar os dois é o que revela a sua própria relação entre rastreamento e referência.
Devo bloquear o Bytespider?
É o caso em que o bloqueio tem a melhor justificativa. O agente responde por 13,5% do rastreamento de treino, a ByteDance é a única operadora marcada com "não" nos três critérios de transparência avaliados pela Cloudflare, e a referência que a plataforma devolve vem do TikTok, não de uma resposta que cite o seu site. Como se trata de um agente de treino, bloqueá-lo não afeta a sua presença em nenhum buscador nem em nenhum assistente.
Em resumo
Bloquear rastreadores de IA é uma decisão de negócio, não de configuração, e ela se divide em três escolhas com preços distintos. Recusar treino é barato, reversível e legítimo para quem vive do que publica. Recusar busca é caro, porque equivale a sair de um índice. Recusar visitas acionadas por pessoas quase nunca compensa. No Google, treino e busca chegam pelo mesmo agente, e por isso ali a única saída disponível é a saída inteira.
O erro mais comum não é bloquear demais nem de menos. É bloquear o agente errado achando que se está bloqueando outro. Antes de mexer no arquivo, saiba qual porta você está fechando e o que existe do outro lado dela.