Cloudflare separa por fin el rastreo de buscadores del entrenamiento de IA

Cloudflare ha anunciado nuevos controles para que las webs puedan decidir de forma independiente si permiten que su contenido aparezca en buscadores, se utilice para entrenar modelos de inteligencia artificial o sea consultado por agentes de IA. La compañía también introduce una nueva categoría de rastreadores “Accountable” y señala a Apple, Google y Microsoft como operadores que cumplen sus criterios o han fijado plazos concretos para hacerlo.

Las claves del control del contenido web en 20 segundos

  • El 36,6 % del tráfico de crawlers verificados en Cloudflare procede de rastreadores de uso mixto.
  • El nuevo control permite bloquear el entrenamiento de IA sin desaparecer de los resultados de búsqueda.
  • Cloudflare separa ahora las preferencias para buscadores, entrenamiento y agentes de IA.
  • Apple, Google y Microsoft aparecen como operadores “Accountable” según los criterios de Cloudflare.
  • La compañía prepara un sistema para gestionar también el uso de contenido en resúmenes generados por IA.

Durante casi tres décadas, el modelo de funcionamiento de la web fue relativamente sencillo: los buscadores rastreaban páginas, incorporaban su contenido a sus índices y enviaban visitas a los sitios originales. La expansión de la inteligencia artificial ha introducido un segundo uso del mismo contenido: alimentar modelos de entrenamiento, sistemas de respuesta y agentes capaces de consultar páginas para ejecutar tareas.

Ese cambio ha generado un problema para los editores. Bloquear determinados rastreadores podía impedir que su contenido se utilizara para entrenar modelos, pero también podía afectar a su presencia en los buscadores cuando ambos usos dependían del mismo crawler.

Cloudflare quiere separar esas decisiones.

Tres permisos distintos para una misma web

La principal novedad es la sustitución del antiguo interruptor “Block AI Bots” por tres controles independientes. Los propietarios de una web pueden decidir por separado sobre el rastreo para búsquedas, el entrenamiento de IA y el acceso de agentes de inteligencia artificial.

La diferencia puede ser importante para medios digitales, tiendas online, blogs, documentación técnica y cualquier sitio cuyo tráfico dependa de los buscadores.

Cloudflare propone además una configuración inicial en función del modelo de negocio. Para los sitios que muestran publicidad, recomienda mantener habilitado el rastreo para búsquedas, bloquear el entrenamiento de IA y restringir a los agentes de IA en las páginas con anuncios.

Para el resto de sitios, la configuración recomendada permite los tres usos.

Son recomendaciones de configuración de Cloudflare, no una norma general para Internet. Cada propietario puede modificarlas según sus necesidades.

La compañía también cambia el funcionamiento de su sistema de preferencias de robots. “Managed Robots.txt” deja paso a Bot Preference Sync, diseñado para que las preferencias del propietario se puedan establecer una vez y aplicarse automáticamente a los rastreadores compatibles.

El objetivo es reducir una de las dificultades que ha aparecido con la proliferación de bots: ya no basta con distinguir entre “buscador” y “bot de IA”, porque algunos operadores utilizan rastreadores para varias funciones.

Los crawlers de uso mixto concentran el problema

Cloudflare afirma que los rastreadores de uso mixto, capaces de recopilar información tanto para índices de búsqueda como para sistemas de IA, representan el 36,6 % del tráfico de crawlers verificados observado en su red. Según la compañía, es actualmente la categoría individual más grande.

El comportamiento de los propietarios de sitios muestra una diferencia clara entre ambos usos. Cloudflare señala que menos del 1 % bloquea los rastreadores de búsqueda, mientras que el 17 % restringe el entrenamiento de IA.

La lectura que hace la compañía es que la mayoría de los sitios quiere seguir siendo descubierta a través de buscadores, aunque una parte creciente no quiere que ese mismo contenido se utilice para entrenar modelos.

Hasta ahora, cuando un crawler no ofrecía controles suficientemente diferenciados, bloquearlo podía tener efectos sobre ambos usos. La nueva configuración de Cloudflare intenta evitar ese intercambio.

El sistema no depende únicamente de que Cloudflare clasifique a un bot como buscador o como herramienta de IA. La compañía está creando una categoría denominada Accountable, destinada a identificar operadores que ofrecen determinados controles y compromisos sobre el uso del contenido.

Qué exige Cloudflare a un crawler “Accountable”

Cloudflare establece cuatro condiciones para considerar responsable y transparente el rastreo relacionado con IA.

La primera consiste en ofrecer a los propietarios de sitios una forma clara de impedir el uso del contenido para entrenamiento mediante robots.txt u otro estándar comparable.

La segunda exige permitir que una web pueda rechazar el uso de su contenido en resúmenes generados por IA.

La tercera está relacionada con la visibilidad: los operadores deben proporcionar información a nivel de URL sobre cómo se utiliza el contenido, tanto para búsquedas como para entrenamiento.

La cuarta establece que rechazar el entrenamiento no debe provocar una penalización en la clasificación dentro de la búsqueda tradicional.

Cloudflare identifica actualmente a Apple, Google y Microsoft como operadores que han demostrado cumplir esos criterios o han comunicado plazos específicos para hacerlo.

Google, por ejemplo, dispone de Google-Extended, un mecanismo que permite a los sitios controlar determinados usos relacionados con el entrenamiento sin retirar necesariamente su contenido de Google Search. La clasificación de Cloudflare se refiere a sus propios criterios de responsabilidad y no constituye una certificación universal de todos los usos que pueda realizar cada compañía.

La compañía también indica que otros operadores utilizan crawlers separados para búsqueda y entrenamiento. En esos casos, Cloudflare puede bloquear específicamente los rastreadores destinados al entrenamiento sin bloquear el acceso de los buscadores.

La lista de operadores que Cloudflare considera que cumplen sus condiciones se publica en Cloudflare Radar.

El siguiente frente son los resúmenes de IA

El control sobre el entrenamiento es solo una parte del problema. Los buscadores y asistentes están incorporando cada vez más respuestas generadas directamente a partir de páginas web, lo que cambia la relación entre contenido original y tráfico.

Cloudflare señala que todos los operadores que reciban la designación “Accountable” deberán ofrecer también una opción para que los propietarios puedan rechazar el uso de su contenido en resúmenes generados por IA.

Actualmente, según la compañía, esa decisión funciona como una opción de sí o no y debe configurarse individualmente para cada operador. Cloudflare plantea para principios de 2027 un sistema que permita controlar desde un único lugar cuánto contenido puede utilizar cada operador en este tipo de respuestas.

La fecha es un objetivo anunciado por la compañía, no una disponibilidad garantizada.

Cloudflare también participa en el trabajo del Internet Engineering Task Force (IETF) sobre ai-prefs, una especificación en desarrollo que pretende crear una forma estandarizada y portable de expresar las preferencias de acceso de una web frente a sistemas de inteligencia artificial.

La cuestión técnica de fondo es cada vez más relevante. Una página puede querer ser indexada por Google, aparecer en un buscador basado en IA, impedir que sus contenidos se utilicen para entrenar modelos y, al mismo tiempo, permitir que un agente consulte determinadas páginas para realizar una tarea. Con reglas binarias de “permitir” o “bloquear”, esas situaciones son difíciles de gestionar.

La propuesta de Cloudflare convierte esas preferencias en controles separados y traslada parte de la decisión desde los operadores de los crawlers hacia quienes publican el contenido.

Para los medios y otros negocios digitales, el cambio puede tener especial interés porque permite plantear la visibilidad en buscadores y el entrenamiento de modelos como decisiones distintas. Queda, sin embargo, una cuestión abierta: que exista un control técnico no significa automáticamente que todos los rastreadores, modelos y agentes del ecosistema lo respeten. De ahí la importancia de estándares comunes como robots.txt y los trabajos que se están desarrollando alrededor de ai-prefs.

encuentra artículos

newsletter

Recibe toda la actualidad del sector tech y cloud en tu email de la mano de RevistaCloud.com.

Suscripción boletín

LO ÚLTIMO