Como bloquear IA no robots.txt com Google-Extended e llms.txt

Como bloquear IA no robots.txt com Google-Extended e llms.txt

O Acordo Informal da Internet Está Quebrando — E Isso Muda Tudo Para Quem Publica

Eu trabalho com web há mais de uma década. Sempre ouvi a mesma frase em eventos, meetups e conferências: “se não pode ser encontrado no Google, não existe.” Esse mantra sustentou uma economia inteira — a do tráfego orgânico, do SEO, do conteúdo monetizado por pageviews.

O problema é que esse pacto não escrito começou a ruir quando o Google decidiu que sabe responder melhor que o site original. Segundo o Eurisko.com.br, o buscador agora testa formas de permitir que editores bloqueiem o uso de seu conteúdo em IA generativa sem perder visibilidade na busca tradicional. É a primeira rachadura institucional nesse acordo de décadas.

Na minha experiência, quem publica conteúdo técnico, tutoriais ou documentação vive um dilema: bloquear a IA significa sumir dos AI Overviews; liberar significa treinar o modelo que vai canibalizar seu próprio tráfego. Esse artigo é sobre como navegar esse cenário como dev.

O Que Mudou na Arquitetura do Google Search

Durante anos, o pipeline era simples: o Googlebot rastreava páginas, indexava, ranqueava e enviava cliques. O publisher lucrava com tráfego, ads, conversões. A IA generativa quebrou esse fluxo porque introduziu um terceiro estágio — a síntese.

Hoje, quando alguém pesquisa “como configurar NGINX com proxy reverso”, o AI Overview entrega um resumo mastigado, com snippet de código e tudo, sem clicar em nada. O publisher que escreveu o tutorial original vira apenas uma fonte invisível por trás do resumo. Para o usuário, ótimo. Para quem produz, é devastador.

O movimento do Google de testar controles granulares — permitir bloquear uso em IA sem bloquear indexação — é, na prática, separar dois pipelines:

  • Pipeline de busca tradicional: rastreamento, indexação, ranking, cliques.
  • Pipeline de IA generativa: ingestão para treinamento, grounding para respostas, citação em AI Overviews.

Até 2024, esses dois pipelines compartilhavam a mesma porta de entrada. Agora o Google reconhece formalmente que são usos distintos, com regras distintas.

O Caso do Reino Unido e Por Que Ele Importa Para Devs Fora da Europa

A Competition and Markets Authority (CMA) determinou, em junho de 2026, que o Google precisa oferecer aos editores controles efetivos sobre o uso de conteúdo em recursos generativos. A exigência inclui transparência sobre como o material é consumido e métricas de engajamento dos usuários com publishers dentro das experiências de busca com IA.

Se você acha que isso só afeta Londres, está errado. Reguladores europeiam tendem a funcionar como farol: o que a CMA aceita vira padrão global, porque o Google não vai manter duas arquiteturas diferentes. Quando a LGPD virou GDPR, vimos o mesmo padrão.

Na prática, isso significa que, em breve, todo publisher vai poder declarar no painel do Search Console algo como: “quero aparecer nos resultados orgânicos, mas não quero meu conteúdo em AI Overviews.” Hoje isso é parcialmente possível via robots.txt e o token Google-Extended, mas a granularidade ainda é limitada.

Na Prática: Como Implementar o Bloqueio Granular Hoje

Se você roda um site técnico (blog, documentação, SaaS), já pode se preparar. Existem três mecanismos que funcionam hoje e que recomendo combinar conforme o caso de uso.

1. Google-Extended via robots.txt

O Google lançou o Google-Extended como um produto-token separado. Ele não afeta indexação nem ranking — apenas o uso do conteúdo para treinar e fundamentar Bard/Gemini e AI Overviews. Exemplo funcional para um site que quer manter busca, mas bloquear IA generativa:

# Permite indexação normal no Google Search
User-agent: Googlebot
Allow: /

# Bloqueia uso do conteúdo em IA generativa (Bard/Gemini/AI Overviews)
User-agent: Google-Extended
Disallow: /

# Bloqueia explicitamente os principais crawlers de IA conhecidos
User-agent: GPTBot
Disallow: /

User-agent: ClaudeBot
Disallow: /

User-agent: PerplexityBot
Disallow: /

User-agent: anthropic-ai
Disallow: /

User-agent: Bytespider
Disallow: /

User-agent: CCBot
Disallow: /

Cuidado com essa armadilha: muitos devs tratam User-agent: * como solução mágica, mas crawlers de IA específicos ignoram *. Você precisa listar cada bot explicitamente.

2. llms.txt — O Padrão que Ainda Não é Padrão

Jeremy Howard propôs em 2024 o llms.txt, um arquivo na raiz que descreve para LLMs qual conteúdo do site pode ser usado. É uma tentativa de criar um robots.txt específico para modelos de linguagem. Ainda não é oficial, mas ferramentas como Cursor, Devin e vários sistemas RAG já respeitam.

# llms.txt
# Documentação Técnica — Permitido para uso em IA generativa

## Conteúdo autorizado
- /docs/api/reference
- /blog/tutorial-nginx

## Conteúdo restrito
- /blog/opiniao-mercado
- /area-cliente/

Na minha experiência, é uma camada extra de sinalização. Não substitui robots.txt, mas ajuda sistemas RAG que já indexam sites.

3. Cloudflare AI Block e Tarpit

Se você roda na Cloudflare, já existe um toggle nativo: AI Scrapers / Crawlers em Security → Bots. Em produção, ativei isso em três projetos e o impacto em tráfego humano foi zero. O que muda é que crawlers como GPTBot e ClaudeBot começam a receber 403 ou respostas lentas propositais (tarpit).

Comparação: As Alternativas Para Quem Publica Conteúdo Técnico

Mecanismo Granularidade Adoção Real Risco de Perder SEO
Google-Extended Alta (só IA, não busca) Total (oficial Google) Baixo
Block user-agent específico Alta por bot Média (bots ignoram) Médio
llms.txt Alta por URL Baixa (emergente) Baixo
Cloudflare AI Block Global no domínio Total (rede) Zero
Pagamento por rastreamento Conteúdo premium Testes (Cloudflare, TollBit) Zero (mas exige infra)

Quando uso X, percebo que a combinação mais robusta hoje é: Google-Extended no robots.txt + Cloudflare AI Block ativo + lista explícita dos bots mais agressivos. É redundante, mas é o que funciona enquanto o ecossistema não converge.

Erros Comuns que Desenvolvedores Cometem

Testei isso em produção em sites meus e de clientes. Os deslizes mais frequentes:

  1. Confundir indexação com uso em IA. Bloquear Googlebot inteiro mata seu SEO. Você quer bloquear Google-Extended, não Googlebot.
  2. Assumir que User-agent: * cobre todos os bots. Não cobre. Crawlers como GPTBot, ClaudeBot e Bytespider usam tokens próprios.
  3. Não diferenciar conteúdo público de conteúdo premium. Se você tem área logada, a proteção é outra (token, auth, rate limiting). robots.txt é só convenção.
  4. Esquecer do /api/ e endpoints JSON. Crawlers de IA adoram endpoints estruturados. Considere bloquear ou rate-limit.
  5. Não monitorar mudanças no log de acesso. Você precisa ver quem está te rastreando. Sem log, está no escuro.
  6. Tratar llms.txt como lei. Hoje é sugestão. Tem peso moral e técnico crescente, mas não substitui bloqueio real.

O Que Vem Por Aí: Monetização do Conteúdo Para IA

A próxima fronteira, na minha leitura, é cobrança por rastreamento. Cloudflare, TollBit e até a própria Apache (projeto Bot Traffic Amplification) já testam modelos em que o crawler paga por página consumida. Isso muda a economia do conteúdo: em vez de CPM por view humano, vira CPM por scrape de IA.

Se você é dev e roda um blog técnico ou documentação pública, comece a planejar:

  • Logs estruturados separados para tráfego humano vs. bot.
  • Endpoint /llms-full.txt agregando conteúdo autorizado.
  • Métricas de “perda de clique” — quando um AI Overview cita você sem referral.
  • Política de licença explícita (X-Robots-Tag headers + llms.txt).

FAQ — Perguntas Reais de Quem Desenvolve

Bloquear Google-Extended me tira do Google Search?
Não. Ele só controla uso em IA generativa. Indexação e ranking continuam normais. É o cenário ideal na maioria dos casos.

Como descubro qual crawler está consumindo meu conteúdo?
Analise o User-Agent nos logs do servidor. Bots legítimos se identificam. Bots maliciosos fingem ser Chrome, e aí entram WAF e análise comportamental.

Vale a pena bloquear todos os bots de IA hoje?
Depende do modelo de negócio. Se você vende cursos, consultoria ou SaaS, perder citação em AI Overview pode doer. Se você vive de ads, bloquear é inevitável. Não existe resposta única.

llms.txt substitui robots.txt?
Não. São camadas diferentes. robots.txt é bloqueio real (na teoria). llms.txt é licença semântica. Use os dois.

O que faço se meu conteúdo já foi usado para treinar modelos?
Infelizmente, água passada. A regulação atual mira uso futuro, não retroativo. Foque em blindar o pipeline daqui pra frente e documentar sua política publicamente.

Gostou? Me segue no GitHub e deixa um comentário se tiver dúvida ou quiser aprofundar algum ponto.

Y

Yuri Sousa

Front-End Developer / Designer

Desenvolvedor apaixonado por criar experiências digitais acessíveis e visualmente perfeitas. Escrevo sobre desenvolvimento web, design e tecnologia.