Olha só o que mudou em 12 meses
Há um ano, a Cloudflare declarou o Content Independence Day e virou uma chavinha: domínios novos passariam a bloquear crawlers de treinamento de IA por padrão, a não ser que o dono liberasse. A aposta era simples — transparência + escassez = mercado.
Doze meses depois, os dados mostram que a aposta funcionou. E mais rápido do que qualquer um previa.
Três números contam a história toda:
- Mais de 30% da humanidade (2,5 bilhões de pessoas) já usa IA generativa regularmente — adoção rolando a ~2x a velocidade dos smartphones.
- Mais de 50% do tráfego da Internet agora é não-humano. Tráfego de agentes cruzou a maioria pela primeira vez.
- 52% das requisições de crawlers são para treinamento de IA (junho/2026), contra 22% na primavera de 2025.
Se você mantém um site, publica docs ou roda uma API, isso não é problema dos outros. É problema da sua infra.
Os dados completos vêm do Cloudflare Radar e do deck de Investor Day 2026 — dá uma olhada no relatório original pra ver os números crus.
Por que o modelo antigo quebrou
Por 25 anos o acordo foi simples: você publica conteúdo de graça, o Google indexa, o Google devolve tráfego de referência, você monetiza esse tráfego. Esse loop tá desmoronando. O usuário agora joga um prompt na IA e recebe uma resposta consolidada — sem clique, sem sessão, sem impressão de anúncio.
Alguns verticais muito crawleados viram queda de até 40% no tráfego humano em menos de um ano. Tem publisher se preparando abertamente pro "Google Zero".

A Mudança na Composição dos Crawlers (E Por Que Bots Mistos São o Verdadeiro Problema)
Quando a Cloudflare separa o tráfego de crawlers por propósito declarado, a tendência é clara:
| Tipo de Crawler | Primavera 2025 | Junho 2026 |
|---|---|---|
| Treinamento de IA | 22% | 52% |
| Uso misto (busca + agente + treino) | — | 36%+ |
| Busca pura | maioria | pequena e caindo |
Aquela linha do meio é a armadilha. Um crawler de uso misto junta indexação de busca, recuperação de agente e treinamento de modelo num único user-agent. Da borda da rede, você não consegue saber se aquela requisição é descoberta (que devolve tráfego) ou raspagem de treino (que não devolve nada).
O Google é o exemplo clássico. Como usa um único bot misto, donos de site acabam tendo que escolher entre:
- Ser descobrível no Google Search (ainda ~88% do tráfego de referência), ou
- Sair do treinamento de IA e dos AI Overviews do Google.
Você não consegue um sem o outro. Isso é mais ou menos 2x de assimetria de informação comparado a empresas de IA que separam limpinho GPTBot de OAI-SearchBot, ou ClaudeBot de Claude-User.
Como fica uma política de crawler decente em 2026
Se você cuida de infra, essa é a postura prática:
# nginx: separa descoberta de treinamento na borda
map $http_user_agent $crawler_class {
default "desconhecido";
~*GPTBot "treinamento_ia";
~*ClaudeBot "treinamento_ia";
~*Google-Extended "treinamento_ia";
~*OAI-SearchBot "busca";
~*Claude-User "agente";
~*Googlebot "busca_ou_ia"; # misto — decida a política
}
server {
# Libera busca + agente, bloqueia treinamento puro
if ($crawler_class = "treinamento_ia") {
return 403;
}
# Limita bots mistos pra você conseguir medir intenção
limit_req zone=crawler burst=20 nodelay;
}
O ponto-chave: robots.txt é pedido, não enforcement. Se você quer alavancagem real numa negociação de licenciamento, precisa de atribuição em nível de rede — logs que provam quem crawleou o quê, com que frequência, e qual fração desses hits virou referência.
Essa razão crawl-para-referral é o número mais valioso que você pode levar pra mesa. Transforma "achamos que nosso conteúdo é valioso" em "aqui estão as evidências".
Pra quem constrói do lado da IA, a lógica se inverte: se você quer acesso limpo a conteúdo premium, se identifique, declare intenção e respeite sinais de frescor. Crawling indiscriminado queima seu orçamento de compute e destrói a boa vontade que você precisa pra fechar licenciamento.

O Que Ficar de Olho — e O Que Desconfiar
O mercado é real, mas pequeno
Mais de 50 acordos publisher-IA foram assinados desde 2023. Parece muito até você comparar com o número de publishers que perderam receita de referência. Acordos bespoke não escalam, e não vão substituir totalmente a receita de anúncio e afiliado pra cauda longa.
Se você é dev solo ou site pequeno, não espere cheque. Espere:
- Zero tráfego de referência dos answer engines de IA.
- Conta de banda mais alta por causa dos crawlers de treino.
- Nenhum assento na mesa de licenciamento, a não ser que você se agregue com outros.
O "problema de convergência do Google" não tá resolvido
O crawler misto do Google é uma assimetria estrutural. Até reguladores ou o mercado forçarem separação clara entre user-agents de descoberta e treino, publishers ficam num binário falso. A Cloudflare prometeu publicamente zerar o tráfego de crawlers mistos até meados de 2027 — trate como meta, não como fato.
Sinais de frescor são a próxima fronteira
IA melhor não precisa de mais crawling; precisa de crawling mais inteligente. Sinais de frescor em tempo real (o que mudou, quando, quão confiável) são onde vai rolar a próxima rodada de competição de infra. Se você publica conteúdo que muda — docs, preços, changelogs — investir em metadados estruturados de frescor agora te coloca na frente.
O que fazer nesse trimestre
- Audite seus logs. Classifique hits por user-agent. Calcule razão crawl-para-referral por bot.
- Enforce na borda, não no robots.txt. Usa Cloudflare, Fastly ou seu próprio map do nginx.
- Publique metadados de frescor.
Last-Modified,ETage structured data são ganhos baratos. - Entre num coletivo. Alavancagem individual é quase zero; licenciamento coletivo é onde o dinheiro realmente anda.
Se você constrói produtos voltados pra agentes, o inverso vale: auto-identificação limpa agora é vantagem competitiva, não checkbox de compliance. As empresas de IA que publishers vão licenciar primeiro são as que aparecem com intenção declarada e dados de atribuição limpos.
Pra uma olhada relacionada em como a economia das plataformas de IA tá mudando do lado do dev, dá uma lida no nosso breakdown do GPT-5.6 GA no Microsoft Foundry e o que isso significa pra devs de agentes.
![]()
Resumindo
A Internet agêntica não é previsão — é o estado atual da rede. Tráfego não-humano é maioria. Treinamento de IA é o propósito dominante dos crawlers. A troca de referência-por-acesso que financiou a web aberta por duas décadas tá quebrada.
O que substitui isso ainda tá sendo construído. Transparência, identidade verificável de bot e enforcement em nível de rede são as primitivas. Mercados de licenciamento, sinais de frescor e negociação coletiva são a próxima camada.
Pra devs e donos de site, o recado é direto: trate crawlers de IA como preocupação de infra, não como nota de rodapé de política. Logue, classifique, limite e meça a razão crawl-para-referral. Esses dados são sua alavancagem.
Pra times do lado da IA, o espelho vale: as empresas que vão conseguir acesso licenciado a conteúdo premium são as que aparecem com intenção declarada e sinais limpos. Crawling indiscriminado é vitória de curto prazo e passivo de longo prazo.
A Internet sempre evoluiu. Essa rodada é mais rápida. A infra pra sobreviver a ela tá sendo escrita agora — e tá aberta pra qualquer um construir em cima.
Leitura complementar
- Os 10 anos de investimento da Meta no Python e o que isso significa pro ecossistema — uma história paralela de apostas de infraestrutura de longo prazo que valeram a pena.
- Relatório original da Cloudflare — os dados-fonte por trás de cada número aqui.