Olha só o que mudou em 12 meses

Há um ano, a Cloudflare declarou o Content Independence Day e virou uma chavinha: domínios novos passariam a bloquear crawlers de treinamento de IA por padrão, a não ser que o dono liberasse. A aposta era simples — transparência + escassez = mercado.

Doze meses depois, os dados mostram que a aposta funcionou. E mais rápido do que qualquer um previa.

Três números contam a história toda:

  • Mais de 30% da humanidade (2,5 bilhões de pessoas) já usa IA generativa regularmente — adoção rolando a ~2x a velocidade dos smartphones.
  • Mais de 50% do tráfego da Internet agora é não-humano. Tráfego de agentes cruzou a maioria pela primeira vez.
  • 52% das requisições de crawlers são para treinamento de IA (junho/2026), contra 22% na primavera de 2025.

Se você mantém um site, publica docs ou roda uma API, isso não é problema dos outros. É problema da sua infra.

Os dados completos vêm do Cloudflare Radar e do deck de Investor Day 2026 — dá uma olhada no relatório original pra ver os números crus.

Por que o modelo antigo quebrou

Por 25 anos o acordo foi simples: você publica conteúdo de graça, o Google indexa, o Google devolve tráfego de referência, você monetiza esse tráfego. Esse loop tá desmoronando. O usuário agora joga um prompt na IA e recebe uma resposta consolidada — sem clique, sem sessão, sem impressão de anúncio.

Alguns verticais muito crawleados viram queda de até 40% no tráfego humano em menos de um ano. Tem publisher se preparando abertamente pro "Google Zero".

AI chatbot interface representing agent-driven content consumption replacing traditional search referrals Coding Session Visual

A Mudança na Composição dos Crawlers (E Por Que Bots Mistos São o Verdadeiro Problema)

Quando a Cloudflare separa o tráfego de crawlers por propósito declarado, a tendência é clara:

Tipo de CrawlerPrimavera 2025Junho 2026
Treinamento de IA22%52%
Uso misto (busca + agente + treino)—36%+
Busca puramaioriapequena e caindo

Aquela linha do meio é a armadilha. Um crawler de uso misto junta indexação de busca, recuperação de agente e treinamento de modelo num único user-agent. Da borda da rede, você não consegue saber se aquela requisição é descoberta (que devolve tráfego) ou raspagem de treino (que não devolve nada).

O Google é o exemplo clássico. Como usa um único bot misto, donos de site acabam tendo que escolher entre:

  • Ser descobrível no Google Search (ainda ~88% do tráfego de referência), ou
  • Sair do treinamento de IA e dos AI Overviews do Google.

Você não consegue um sem o outro. Isso é mais ou menos 2x de assimetria de informação comparado a empresas de IA que separam limpinho GPTBot de OAI-SearchBot, ou ClaudeBot de Claude-User.

Como fica uma política de crawler decente em 2026

Se você cuida de infra, essa é a postura prática:

# nginx: separa descoberta de treinamento na borda
map $http_user_agent $crawler_class {
    default                       "desconhecido";
    ~*GPTBot                      "treinamento_ia";
    ~*ClaudeBot                   "treinamento_ia";
    ~*Google-Extended             "treinamento_ia";
    ~*OAI-SearchBot               "busca";
    ~*Claude-User                 "agente";
    ~*Googlebot                   "busca_ou_ia";  # misto — decida a política
}

server {
    # Libera busca + agente, bloqueia treinamento puro
    if ($crawler_class = "treinamento_ia") {
        return 403;
    }
    # Limita bots mistos pra você conseguir medir intenção
    limit_req zone=crawler burst=20 nodelay;
}

O ponto-chave: robots.txt é pedido, não enforcement. Se você quer alavancagem real numa negociação de licenciamento, precisa de atribuição em nível de rede — logs que provam quem crawleou o quê, com que frequência, e qual fração desses hits virou referência.

Essa razão crawl-para-referral é o número mais valioso que você pode levar pra mesa. Transforma "achamos que nosso conteúdo é valioso" em "aqui estão as evidências".

Pra quem constrói do lado da IA, a lógica se inverte: se você quer acesso limpo a conteúdo premium, se identifique, declare intenção e respeite sinais de frescor. Crawling indiscriminado queima seu orçamento de compute e destrói a boa vontade que você precisa pra fechar licenciamento.

Cloudflare global server network powering bot attribution and crawler enforcement for publishers Developer Related Image

O Que Ficar de Olho — e O Que Desconfiar

O mercado é real, mas pequeno

Mais de 50 acordos publisher-IA foram assinados desde 2023. Parece muito até você comparar com o número de publishers que perderam receita de referência. Acordos bespoke não escalam, e não vão substituir totalmente a receita de anúncio e afiliado pra cauda longa.

Se você é dev solo ou site pequeno, não espere cheque. Espere:

  • Zero tráfego de referência dos answer engines de IA.
  • Conta de banda mais alta por causa dos crawlers de treino.
  • Nenhum assento na mesa de licenciamento, a não ser que você se agregue com outros.

O "problema de convergência do Google" não tá resolvido

O crawler misto do Google é uma assimetria estrutural. Até reguladores ou o mercado forçarem separação clara entre user-agents de descoberta e treino, publishers ficam num binário falso. A Cloudflare prometeu publicamente zerar o tráfego de crawlers mistos até meados de 2027 — trate como meta, não como fato.

Sinais de frescor são a próxima fronteira

IA melhor não precisa de mais crawling; precisa de crawling mais inteligente. Sinais de frescor em tempo real (o que mudou, quando, quão confiável) são onde vai rolar a próxima rodada de competição de infra. Se você publica conteúdo que muda — docs, preços, changelogs — investir em metadados estruturados de frescor agora te coloca na frente.

O que fazer nesse trimestre

  1. Audite seus logs. Classifique hits por user-agent. Calcule razão crawl-para-referral por bot.
  2. Enforce na borda, não no robots.txt. Usa Cloudflare, Fastly ou seu próprio map do nginx.
  3. Publique metadados de frescor. Last-Modified, ETag e structured data são ganhos baratos.
  4. Entre num coletivo. Alavancagem individual é quase zero; licenciamento coletivo é onde o dinheiro realmente anda.

Se você constrói produtos voltados pra agentes, o inverso vale: auto-identificação limpa agora é vantagem competitiva, não checkbox de compliance. As empresas de IA que publishers vão licenciar primeiro são as que aparecem com intenção declarada e dados de atribuição limpos.

Pra uma olhada relacionada em como a economia das plataformas de IA tá mudando do lado do dev, dá uma lida no nosso breakdown do GPT-5.6 GA no Microsoft Foundry e o que isso significa pra devs de agentes.

Network traffic visualization showing over 50 percent non-human agent traffic on the modern Internet Programming Illustration

Resumindo

A Internet agêntica não é previsão — é o estado atual da rede. Tráfego não-humano é maioria. Treinamento de IA é o propósito dominante dos crawlers. A troca de referência-por-acesso que financiou a web aberta por duas décadas tá quebrada.

O que substitui isso ainda tá sendo construído. Transparência, identidade verificável de bot e enforcement em nível de rede são as primitivas. Mercados de licenciamento, sinais de frescor e negociação coletiva são a próxima camada.

Pra devs e donos de site, o recado é direto: trate crawlers de IA como preocupação de infra, não como nota de rodapé de política. Logue, classifique, limite e meça a razão crawl-para-referral. Esses dados são sua alavancagem.

Pra times do lado da IA, o espelho vale: as empresas que vão conseguir acesso licenciado a conteúdo premium são as que aparecem com intenção declarada e sinais limpos. Crawling indiscriminado é vitória de curto prazo e passivo de longo prazo.

A Internet sempre evoluiu. Essa rodada é mais rápida. A infra pra sobreviver a ela tá sendo escrita agora — e tá aberta pra qualquer um construir em cima.

Leitura complementar

Este conteúdo foi elaborado com o auxílio de ferramentas de IA, com base em fontes confiáveis, e revisado pela nossa equipe editorial antes da publicação. Não substitui o aconselhamento de um profissional especializado.