Canis conteúdos / noticias
Menu
Falar com a Canis ↗
Notícias

Bots de IA: bloquear por engano agora custa visibilidade

Por Vinicius Moreira 6 min de leitura
Três corredores paralelos com cancelas: uma aberta e duas fechadas
A escolha deixou de ser uma: busca, agente e treinamento têm portas separadas.
Tópicos desta notícia (8)
  1. 01O que aconteceu
  2. 02Por que isso está acontecendo
  3. 03O que isso muda para uma PME brasileira
  4. 04Onde faz sentido usar
  5. 05Riscos e limites
  6. 06O que avaliar antes de implementar
  7. 07Fontes
  8. 08Conclusão

O que aconteceu

Desde 15 de setembro de 2026, bloquear crawler de IA deixou de ser um interruptor único. A Cloudflare — que responde por mais de 20% dos domínios do mundo — aposentou a opção “Block AI Bots” e passou a separar o tráfego automatizado em três controles independentes: busca, agente e treinamento (anúncio oficial da Cloudflare). Junto veio o “Disallow AI Training”, que recusa treinamento sem tirar o site da busca, e a mudança de significado do bloqueio total: a opção agora alcança também os crawlers de uso misto — Googlebot, Bingbot e Applebot — e derruba a busca tradicional junto (release da Cloudflare).

Para domínio novo que exibe anúncio, a configuração recomendada passou a ser busca liberada, treinamento recusado e agentes bloqueados nas páginas com anúncio; site sem anúncio começa com os três liberados. A escolha, agora, precisa ser explícita — e errar de botão tem efeito colateral na busca.

Do outro lado da pilha, o Google liberou em 31 de agosto de 2026 o controle de IA generativa do Search Console, que permite sair dos recursos de IA da busca sem perder posição na busca tradicional (Google).

Por que isso está acontecendo

O volume explica. Em 2025, 53% de todo o tráfego da web já era automatizado, contra 47% humano, e os ataques com bots turbinados por IA cresceram 12,5 vezes em um ano (2026 Thales Bad Bot Report). Na Cloudflare, as requisições diárias de agentes de IA cresceram mais de 1.700% em doze meses (Cloudflare).

O que virou a chave foi a proporção de uso: na primavera de 2025, 22% das requisições de crawler declaradas eram para treinamento; em junho de 2026, 52% (Cloudflare). Crawlers de uso misto — o mesmo robô servindo busca e treinamento — já são 36,6% do tráfego verificado de crawlers, a maior categoria isolada, e menos de 1% dos sites bloqueia crawler de busca, enquanto 17% restringem treinamento (release da Cloudflare).

Traduzindo: o dono de site nunca quis desaparecer da busca, quis parar de alimentar de graça o modelo de outra empresa. Até setembro, as duas coisas vinham no mesmo pacote.

Requisições de crawler para treinamento: 22% em 2025 e 52% em 2026
Requisições de crawler para treinamento: 22% em 2025 e 52% em 2026

O que isso muda para uma PME brasileira

O Brasil está no lado aberto da balança. Um levantamento com 507.922 sites brasileiros mostrou que 4,16% bloqueiam algum crawler de IA e 95,86% não bloqueiam nenhum bot de treinamento; 88,83% não tomaram decisão alguma — nem bloquearam, nem declararam política (Piperic, AI Access Report Brasil). Entre as lojas online, 96,4% (73.904 de 76.640) estão abertas a crawlers de IA, que já leem, comparam e recomendam o catálogo (Piperic).

95,86% dos sites não bloqueiam treinamento, 96,4% das lojas estão abertas a crawlers de IA e 4,16% bloqueiam algum crawler
95,86% dos sites não bloqueiam treinamento, 96,4% das lojas estão abertas a crawlers de IA e 4,16% bloqueiam algum crawler

Isso importa porque a decisão de compra do brasileiro ganhou um intermediário. Na pesquisa Black Friday Talks, da Stefanini Marketing, 86% dos consumidores vão usar IA nas compras de novembro — para comparar preços (49%), checar se a promoção é real (47%) e avaliar a confiabilidade da loja (42%) —, e cerca de metade das fontes que a IA usa nessas respostas é editorial (UOL Economia).

O detalhe brasileiro está no paradoxo: 19.457 sites bloqueiam o GPTBot para manter o conteúdo fora do treinamento, mas 1.033 deles (5,3%) bloqueiam junto o OAI-SearchBot, o robô que decide se o site aparece nas respostas do ChatGPT (Piperic). Protegeram o conteúdo e sumiram do canal, provavelmente sem saber, porque os dois tokens são independentes no robots.txt.

Onde faz sentido usar

  • Loja com anúncio no site: revisar o que o CDN já bloqueia por padrão. Desde 15/09, recusar treinamento em página com anúncio é o caminho recomendado, mas não pode levar o crawler de busca junto.
  • Site institucional que quer ser citado: liberar busca e agente. A resposta do assistente virou canal de descoberta, e quem não é lido não é citado — é o que a auditoria de SEO da Canis verifica primeiro.
  • Blog ou conteúdo editorial que serve de fonte: permitir busca e citação e decidir treinamento caso a caso. Metade das fontes usadas pela IA em resposta de compra é editorial.
  • Catálogo ou base de preços que é ativo do negócio: aqui bloqueio e cobrança por acesso passam a fazer sentido; é o caso em que sumir da resposta pode valer mais do que aparecer.

Nos quatro casos, o trabalho começa por uma auditoria de indexação.

Riscos e limites

Nada disso é controle de segurança. robots.txt é pedido, não imposição: crawler que ignora o arquivo só para com firewall ou limite de requisições. E a lista tem furos: a Microsoft deve passar a respeitar a preferência de “sem treinamento” via robots.txt apenas no início de 2027; até lá, quem quer bloquear treinamento no Bing precisa usar a meta tag NOARCHIVE (Cloudflare).

Bloquear demais também é irreversível na prática. Conteúdo já absorvido por um modelo não sai do modelo, e o Googlebot é crawler de uso misto: escolher o bloqueio total em treinamento derruba a busca junto. Não existe botão de desfazer.

O que avaliar antes de implementar

Quatro verificações, nesta ordem:

  1. O que o seu CDN ou host já bloqueia por padrão. Configuração antiga ligada sem o dono saber é a causa mais comum de site invisível para IA.
  2. Separe por função, não por nome de robô. Busca (aparecer), agente (atender quem pediu) e treinamento (alimentar modelo) são decisões diferentes; tratar as três como uma só produz o paradoxo brasileiro.
  3. Teste em modo de registro antes de bloquear. Regra promovida direto para bloqueio derruba tráfego legítimo, inclusive o que se quer manter.
  4. Meça o efeito. O Search Console mostra impressões em recursos de IA generativa e permite sair deles sem perder posição na busca tradicional — é o medidor mais próximo do que existe hoje (Google).

Fontes

A informação foi verificada em pelo menos duas fontes independentes. Trechos citados estão entre aspas e atribuídos à fonte original.

Conclusão

A pergunta deixou de ser “bloquear ou não bots de IA” e passou a ser “bloquear o quê, em qual página e por quê”. Com o padrão novo, o silêncio não é neutro: quem não configura fica com o padrão de outra pessoa, e o padrão brasileiro, hoje, é deixar tudo aberto por não ter decidido nada. Antes da Black Friday, vale conferir o que o seu site responde a um robô de IA.

Sua loja aparece quando alguém pergunta à IA? A Canis audita indexação, robots.txt e sinais de IA para responder isso com dado, não com achismo. Falar com a Canis →

Canis · Diagnóstico

Início da conversa