Qué cambia hoy

Los nuevos ajustes predeterminados de Cloudflare para rastreadores de IA entran en vigor el 15 de septiembre. En las páginas que muestran publicidad, los bots que Cloudflare clasifica como de entrenamiento de IA o como agentes de IA quedan bloqueados por defecto, mientras que los rastreadores de búsqueda siguen permitidos, según el anuncio de Cloudflare de julio. Gulf News informó de que el cambio entra en vigor hoy.

Los nuevos ajustes se aplican a los dominios que se incorporan a Cloudflare y a los sitios nuevos de clientes existentes, informó TechCrunch cuando se anunció la política. Los clientes gratuitos que no hubieran cambiado su configuración de bots de IA antes de la fecha también pasan a los nuevos ajustes, según Search Engine Journal. Los propietarios pueden modificar la configuración en el panel de Cloudflare.

Tres categorías y la regla más estricta

Cloudflare clasifica ahora los bots según su finalidad. En sus definiciones, un rastreador de búsqueda “recopila o indexa tu contenido para poder responder preguntas sobre él más adelante”. Un agente es un “comportamiento automatizado que actúa, normalmente en tiempo real, en nombre de una persona”. Un rastreador de entrenamiento es el que “toma tu contenido para entrenar o ajustar un modelo”.

La dificultad está en los rastreadores que hacen más de una de esas cosas. Cloudflare dijo que sus ajustes “se aplicarán según las reglas más restrictivas que correspondan” y citó a Googlebot, Applebot y Bingbot como rastreadores polivalentes que quedan bloqueados para los clientes que decidan bloquear el entrenamiento. Como resumió Search Engine Journal, “un rastreador que hace búsqueda y entrenamiento será bloqueado si un sitio bloquea el entrenamiento”.

Una persona desliza un texto en una tableta sobre una mesa
Cloudflare quiere que los propietarios distingan los rastreadores que ayudan a encontrar contenido de los que lo consumen. Foto de archivo. iam hogir · pexels · Pexels License

Search Engine Journal señaló que el bloqueo de Cloudflare actúa a nivel de red, de modo que, a diferencia de una instrucción en robots.txt, no depende de que el rastreador decida cumplirla. No recogió ninguna respuesta de Google.

Por qué lo hace Cloudflare

La política pretende empujar a las empresas de IA a usar rastreadores separados para búsqueda, agentes y entrenamiento y, según informó TechCrunch en julio, a pagar a los editores por su contenido. “Ahora que la mayor parte del tráfico de internet no es humano, tenemos que ir más lejos y actuar más rápido para que pueda surgir un ecosistema sostenible”, dijo entonces el consejero delegado, Matthew Prince.

El objetivo de Cloudflare “no es simplemente bloquear la IA”, informó Gulf News, sino permitir que los propietarios de webs distingan entre los servicios automatizados que ayudan a la gente a descubrir su contenido y los que lo consumen.

Un portátil muestra una página web sobre un escritorio
Los propietarios pueden cambiar la configuración en el panel de Cloudflare. Foto de archivo. Thirdman · pexels · Pexels License

El riesgo para los editores

Para un sitio financiado con publicidad que haya decidido bloquear el entrenamiento, la regla más estricta supone que los rastreadores principales de Google, Microsoft y Apple pueden quedar fuera junto con los bots de entrenamiento, lo que pone en juego su visibilidad en buscadores. Mientras esas empresas combinen búsqueda y entrenamiento en un mismo rastreador, los editores que usan Cloudflare tendrán que elegir entre permitir el entrenamiento o arriesgar su tráfico de búsqueda.

Qué vigilar

La presión recae ahora en quienes operan rastreadores de uso mixto. Las señales que conviene seguir son si Google, Microsoft o Apple separan la búsqueda y el entrenamiento en rastreadores distintos, y si Cloudflare publica cifras sobre cuántos sitios cubren los nuevos ajustes.