¡Hola Devs! Miren lo que cambió en 12 meses

Hace un año, Cloudflare declaró el Content Independence Day y movió una palanca: los dominios nuevos empezarían a bloquear crawlers de entrenamiento de IA por defecto, salvo que el dueño los habilitara. La apuesta era simple — transparencia + escasez = mercado.

Doce meses después, los datos dicen que la apuesta funcionó. Y más rápido de lo que cualquiera esperaba.

Tres números cuentan toda la historia:

  • Más del 30% de la humanidad (2.5 mil millones de personas) ya usa IA generativa regularmente — adopción a ~2x la velocidad de los smartphones.
  • Más del 50% del tráfico de Internet ahora es no-humano. El tráfico de agentes cruzó la mayoría por primera vez.
  • 52% de las peticiones de crawlers son para entrenamiento de IA (junio/2026), contra 22% en primavera de 2025.

Si mantienes un sitio, publicas docs o corres una API, esto ya no es problema de otros. Es problema de tu infra.

Los datos completos vienen de Cloudflare Radar y su deck de Investor Day 2026 — checa el reporte original para ver los números crudos.

Por qué el modelo viejo se rompió

Por 25 años el trato fue simple: publicas contenido gratis, Google lo indexa, Google te devuelve tráfico de referencia, tú monetizas ese tráfico. Ese loop se está cayendo. El usuario ahora mete un prompt a la IA y recibe una respuesta consolidada — sin clic, sin sesión, sin impresión de anuncio.

Algunos verticales muy crawleados vieron caídas de hasta 40% en tráfico humano en menos de un año. Hay publishers preparándose abiertamente para el "Google Zero".

AI chatbot interface representing agent-driven content consumption replacing traditional search referrals System Abstract Visual

El Cambio en la Composición de Crawlers (Y Por Qué los Bots Mixtos Son el Verdadero Problema)

Cuando Cloudflare separa el tráfico de crawlers por propósito declarado, la tendencia es clarísima:

Tipo de CrawlerPrimavera 2025Junio 2026
Entrenamiento de IA22%52%
Uso mixto (búsqueda + agente + entrenamiento)—36%+
Búsqueda puramayoríapequeña y cayendo

Esa fila del medio es la trampa. Un crawler de uso mixto junta indexación de búsqueda, recuperación de agente y entrenamiento de modelo en un solo user-agent. Desde el borde de la red, no puedes saber si ese hit es descubrimiento (que devuelve tráfico) o raspado de entrenamiento (que no devuelve nada).

Google es el ejemplo canónico. Como usa un solo bot mixto, los dueños de sitios terminan eligiendo entre:

  • Ser descubrible en Google Search (todavía ~88% del tráfico de referencia), o
  • Salir del entrenamiento de IA y los AI Overviews de Google.

No puedes tener uno sin el otro. Eso es más o menos 2x de asimetría de información comparado con empresas de IA que separan limpiamente GPTBot de OAI-SearchBot, o ClaudeBot de Claude-User.

Cómo se ve una política de crawlers decente en 2026

Si mantienes infra, esta es la postura práctica:

# nginx: separa descubrimiento de entrenamiento en el borde
map $http_user_agent $crawler_class {
    default                       "desconocido";
    ~*GPTBot                      "entrenamiento_ia";
    ~*ClaudeBot                   "entrenamiento_ia";
    ~*Google-Extended             "entrenamiento_ia";
    ~*OAI-SearchBot               "busqueda";
    ~*Claude-User                 "agente";
    ~*Googlebot                   "busqueda_o_ia";  # mixto — decide tu política
}

server {
    # Permite búsqueda + agente, bloquea entrenamiento puro
    if ($crawler_class = "entrenamiento_ia") {
        return 403;
    }
    # Limita bots mixtos para que puedas medir intención
    limit_req zone=crawler burst=20 nodelay;
}

El punto clave: robots.txt es una petición, no enforcement. Si de verdad quieres apalancamiento en una negociación de licenciamiento, necesitas atribución a nivel de red — logs que prueben quién crawleó qué, con qué frecuencia, y qué fracción de esos hits alguna vez produjo una referencia.

Esa razón crawl-a-referral es el número más valioso que puedes llevar a la mesa. Convierte "creemos que nuestro contenido vale" en "aquí está la evidencia".

Para quienes construyen del lado de la IA, la lógica se invierte: si quieres acceso limpio a contenido premium, identifícate, declara intención y respeta señales de frescura. Crawling indiscriminado quema tu presupuesto de cómputo y destruye la buena voluntad que necesitas para cerrar licenciamiento.

Cloudflare global server network powering bot attribution and crawler enforcement for publishers Software Concept Art

Qué Vigilar — y De Qué DUDAR

El mercado es real, pero chico

Más de 50 acuerdos publisher-IA firmados desde 2023. Suena impresionante hasta que lo comparas con el número de publishers que perdieron ingresos de referencia. Los acuerdos bespoke no escalan, y no van a reemplazar del todo los ingresos de anuncios y afiliados para la cola larga.

Si eres dev solo o sitio pequeño, no esperes cheque. Espera:

  • Cero tráfico de referencia de los answer engines de IA.
  • Factura de ancho de banda más alta por los crawlers de entrenamiento.
  • Ningún asiento en la mesa de licenciamiento, a menos que te agregues con otros.

El "problema de convergencia de Google" no está resuelto

El crawler mixto de Google es una asimetría estructural. Hasta que reguladores o el mercado fuercen separación clara entre user-agents de descubrimiento y entrenamiento, los publishers están en un binario falso. Cloudflare prometió públicamente llevar a cero el tráfico de crawlers mixtos para mediados de 2027 — trátalo como meta, no como hecho.

Las señales de frescura son la siguiente frontera

Mejor IA no necesita más crawling; necesita crawling más inteligente. Señales de frescura en tiempo real (qué cambió, cuándo, qué tan confiable) son donde va a pasar la siguiente ronda de competencia de infra. Si publicas contenido que cambia — docs, precios, changelogs — invertir en metadatos estructurados de frescura ahora te pone adelante.

Qué hacer este trimestre

  1. Audita tus logs. Clasifica hits por user-agent. Calcula razón crawl-a-referral por bot.
  2. Enforce en el borde, no en robots.txt. Usa Cloudflare, Fastly o tu propio map de nginx.
  3. Publica metadatos de frescura. Last-Modified, ETag y structured data son ganancias baratas.
  4. Únete a un colectivo. El apalancamiento individual es casi cero; el licenciamiento colectivo es donde de verdad se mueve el dinero.

Si construyes productos orientados a agentes, aplica al revés: la auto-identificación limpia ahora es ventaja competitiva, no checkbox de compliance. Las empresas de IA a las que los publishers van a licenciar primero son las que llegan con intención declarada y datos de atribución limpios.

Para una mirada relacionada de cómo la economía de plataformas de IA está cambiando del lado dev, checa nuestro breakdown del GPT-5.6 GA en Microsoft Foundry y qué significa para devs de agentes.

Network traffic visualization showing over 50 percent non-human agent traffic on the modern Internet Developer Related Image

Resumiendo

La Internet agéntica no es pronóstico — es el estado actual de la red. El tráfico no-humano es mayoría. El entrenamiento de IA es el propósito dominante de los crawlers. El intercambio de referencia-por-acceso que financió la web abierta por dos décadas está roto.

Lo que lo reemplaza todavía se está construyendo. Transparencia, identidad verificable de bot y enforcement a nivel de red son las primitivas. Mercados de licenciamiento, señales de frescura y negociación colectiva son la siguiente capa.

Para devs y dueños de sitios, el mensaje es directo: trata los crawlers de IA como preocupación de infra, no como nota al pie de política. Loguea, clasifica, limita y mide la razón crawl-a-referral. Esos datos son tu apalancamiento.

Para equipos del lado de la IA, el espejo aplica: las empresas que van a conseguir acceso licenciado a contenido premium son las que llegan con intención declarada y señales limpias. Crawling indiscriminado es victoria de corto plazo y pasivo de largo plazo.

La Internet siempre evolucionó. Esta ronda es más rápida. La infra para sobrevivirla se está escribiendo ahora — y está abierta para que cualquiera construya encima.

Lectura complementaria

Este contenido fue redactado con la asistencia de herramientas de IA, basándose en fuentes confiables, y fue revisado por nuestro equipo editorial antes de su publicación. No reemplaza el asesoramiento de un profesional especializado.