Patreon deja de confiar solo en robots.txt para frenar el scraping de IA
Patreon refuerza con Cloudflare el bloqueo de rastreadores conocidos que recogen obras para entrenar modelos. La novedad no es cerrar la puerta a toda automatización, sino diferenciar entrenamiento, búsqueda y otros usos.
El 1 de julio de 2026, Patreon anunció que ampliaba con Cloudflare sus protecciones frente al scraping de IA no autorizado: el objetivo declarado es bloquear en la red a rastreadores conocidos que recogen obras de creadores para entrenar modelos, sin bloquear los rastreadores de búsqueda que pueden ayudar a descubrir una página y devolver visitas.
La distinción es importante. No se trata de expulsar toda automatización de Patreon ni de resolver de una vez el debate sobre datos de entrenamiento. Es una decisión técnica y editorial sobre qué tipos de acceso quiere permitir una plataforma de creadores y bajo qué condiciones.
De una petición a un control técnico
Patreon dice que ya tenía medidas desde 2023 para disuadir a empresas de IA de entrenar con obras sin permiso. El nuevo anuncio describe una integración con AI Crawl Control de Cloudflare para actualizar las políticas de rastreadores y las herramientas que las aplican.
Según Patreon, el cambio responde a una realidad de producto: parte del contenido que antes quedaba tras una suscripción de pago ahora puede circular también como medio gratuito en experiencias de descubrimiento, como el rediseño de su inicio y Quips. El muro de pago ofrecía una protección de hecho frente a algunos rastreadores. Al abrir más contenido para que los creadores lleguen a nuevas audiencias, la empresa quiere que la protección viaje con ese contenido.
La plataforma afirma que bloqueará rastreadores conocidos de entrenamiento a nivel de red. En pruebas iniciales, asegura que los intentos semanales de acceso de rastreadores individuales de entrenamiento pasaron de miles a cero. Es un dato de la propia compañía, no una auditoría independiente, pero ilustra el tipo de resultado que busca: no solo declarar una preferencia, sino rechazar solicitudes identificadas antes de que lleguen al contenido.
No todos los bots hacen lo mismo
Cloudflare ha propuesto una clasificación más precisa que la etiqueta genérica de “bot de IA”. Su documentación separa tres usos principales: búsqueda, agentes y entrenamiento. Un rastreador de búsqueda recoge o indexa contenido para responder consultas más adelante; un agente actúa en tiempo real en nombre de una persona; un rastreador de entrenamiento recopila material para entrenar o ajustar un modelo.
La diferencia afecta al equilibrio entre control y descubrimiento. Patreon dice que seguirá permitiendo los rastreadores de búsqueda que pueden dirigir a lectores hacia las páginas originales de los creadores, mientras restringe los dedicados al entrenamiento. Esa política reconoce que la visibilidad no es un beneficio menor para quien publica en internet, pero tampoco exige aceptar cualquier reutilización para obtenerla.
Cloudflare advierte que algunos rastreadores pueden cumplir más de una función. Un mismo operador podría indexar para búsqueda y recopilar datos para entrenamiento. Por eso su sistema clasifica los bots por comportamiento y permite gestionar categorías distintas. Es un avance sobre el “todo o nada”, aunque su eficacia dependerá de que los operadores se identifiquen correctamente y de que el proveedor detecte los cambios de conducta.
Lo que robots.txt sí y no hace
El Robots Exclusion Protocol está documentado por el IETF como un mecanismo para que un sitio indique reglas a rastreadores. Es útil para la cooperación entre servicios, pero no equivale a autenticación ni a un cortafuegos. Las propias opciones de Cloudflare señalan que las preferencias publicadas en robots.txt no bloquean directamente el acceso.
Ese es el salto de Patreon: pasar de pedir a un rastreador que no recoja determinados materiales a usar una capa de red para rechazar a los rastreadores que identifica como destinados al entrenamiento. Ninguna lista de bots será perfecta. Pueden aparecer nuevos identificadores, tráfico que imita a un visitante normal o disputas sobre si una automatización pertenece a búsqueda, a un agente o a entrenamiento.
Por eso el bloqueo técnico no elimina la necesidad de reglas claras y de relaciones transparentes con los operadores de IA. Pero da a los creadores una herramienta más tangible que una instrucción voluntaria.
La iniciativa de Patreon dibuja un modelo posible para la web abierta: permitir la indexación que devuelve audiencia, restringir la recopilación destinada a entrenar modelos sin permiso y hacer visible qué tipo de bot está llamando a la puerta. El reto será aplicar esa separación de forma coherente. Para los creadores, el valor de la medida dependerá menos del eslogan y más de que el contenido pueda seguir encontrando público sin convertirse automáticamente en materia prima para cualquier modelo.
Este artículo se ha elaborado con inteligencia artificial bajo supervisión editorial humana.