SEO para IA

Control de crawlers de IA: GPTBot, ClaudeBot y más

El control de crawlers de IA decide si GPTBot, ClaudeBot y Perplexity entrenan con tu contenido o te citan. Aprende a permitir los bots correctos y bloquear el resto.

SB
Consultor SEO Senior
Publicado el 7 de julio de 2026 · 11 min de lectura
X in
Control de crawlers de IA: GPTBot, ClaudeBot y más

El control de crawlers de IA es la práctica de decidir qué bots de IA —como GPTBot, ClaudeBot y PerplexityBot— pueden rastrear tu sitio, y con qué propósito. Se gestiona sobre todo con directivas en robots.txt y reglas en el CDN, permitiendo los crawlers que pueden citarte en respuestas de IA y bloqueando o restringiendo los que solo extraen contenido para entrenar modelos. Hazlo bien y sigues visible en ChatGPT, Perplexity y las respuestas de IA de Google sin regalar todo tu archivo al entrenamiento de modelos.

Esta decisión antes era una nota al pie. Ahora es una línea real del presupuesto, porque el reparto del tráfico ha cambiado. En junio de 2026, los datos de Cloudflare Radar mostraban que las peticiones automatizadas suponían el 57,5% del tráfico HTML a contenido web frente al 42,5% de humanos: la primera vez que las máquinas tienen la mayoría en la historia de la web. Buena parte de eso son crawlers de IA golpeando tus páginas cada día. Si nunca has mirado quiénes son ni qué se llevan, estás a ciegas en un canal que ya toca la mayor parte de tu ancho de banda.

Esta guía cubre qué hace realmente cada crawler de IA, la distinción crítica entre entrenamiento y búsqueda que casi todos confunden, un marco de decisión para fijar tu política, y cómo implementarla y verificarla sin borrarte por accidente de la búsqueda con IA.

Por qué importa ahora el control de crawlers de IA

Hace tres años solo había dos tipos de bots que importaban: los crawlers de buscadores que te indexaban para posicionar, y los scrapers que querías mantener fuera. Ese binario ya no existe. Los crawlers de IA viven en un punto intermedio confuso: algunos devuelven tráfico, la mayoría no, y la misma empresa suele operar varios con trabajos completamente distintos.

La economía está descompensada. Según el análisis de crawl-to-referral de Cloudflare, Anthropic rastreó unas 4.580 páginas por cada visita de referencia que devolvió, frente a 848 de OpenAI, 186 de Perplexity y unas 5 de Google. Esa brecha resume todo el debate en un dato: la búsqueda tradicional aún cambia rastreo por clics a un ritmo justo, mientras que el rastreo de IA centrado en entrenamiento se lleva mucho más de lo que devuelve.

Al mismo tiempo, la búsqueda con IA es un canal de visibilidad real. Cuando alguien pregunta a ChatGPT o Perplexity y el modelo recupera páginas en vivo para responder, ser rastreable es el precio de ser citado. Bloquea de forma indiscriminada y ganas el argumento de proteger contenido, pero pierdes el de descubrimiento. Auditando sitios durante el último año, la herida autoinfligida más común que veo es un bloqueo general que mata la visibilidad en búsqueda con IA sin frenar a los scrapers decididos. El control de crawlers de IA consiste en trazar esa línea a propósito, no por accidente.

Los crawlers que debes conocer

No todos los bots de IA son iguales. Lo más importante que hay que entender es que los grandes proveedores separan su rastreo en distintos user-agents según el propósito, y puedes permitir uno mientras bloqueas otro.

Crawlers de entrenamiento vs crawlers de búsqueda

Esta es la distinción que lo cambia todo. OpenAI y Anthropic operan cada uno dos bots separados:

  • GPTBot (OpenAI) y ClaudeBot (Anthropic) son crawlers de entrenamiento. Recogen contenido para entrenar y mejorar modelos. Rara vez devuelven tráfico de referencia.
  • OAI-SearchBot (OpenAI) y Claude-SearchBot (Anthropic) son crawlers de búsqueda. Rastrean páginas para responder consultas en vivo y pueden generar una cita con enlace de vuelta a ti.

La implicación es la base de toda política inteligente en 2026: puedes renunciar al entrenamiento de modelos manteniéndote elegible para citas en búsqueda con IA. Bloquear GPTBot no te saca de los resultados de búsqueda de ChatGPT —de eso se encarga OAI-SearchBot—. Los dueños de sitios que meten todos los bots de OpenAI en una sola línea Disallow se borran de las respuestas de IA sin querer.

La división por propósito también importa a escala. En la red de Cloudflare, en los 28 días hasta el 22 de junio de 2026, los rastreos de entrenamiento supusieron el 52,3% de las peticiones de crawlers de IA —más que los dos siguientes propósitos juntos—, mientras que el rastreo con fin de búsqueda que sí puede devolver una cita quedó por debajo del 10%. La mayor parte del rastreo de IA es extracción, no descubrimiento.

Los principales user-agents en 2026

Los bots que la mayoría de sitios ven son: GPTBot y OAI-SearchBot (OpenAI), ClaudeBot y Claude-SearchBot (Anthropic), PerplexityBot (Perplexity), Google-Extended (un token que te saca del entrenamiento de Gemini/Vertex sin afectar a Search), Applebot-Extended (el equivalente para Apple), y CCBot (Common Crawl, que alimenta a muchos modelos posteriores). Bytespider (ByteDance) merece atención: en 2026 escaló hasta convertirse en uno de los crawlers de IA más activos y es agresivo.

Si además te importa cómo estos sistemas eligen luego qué citar, esa es otra disciplina, cubierta en mi playbook de generative engine optimization. El control de acceso decide si estás en el grupo; el GEO decide si te eligen.

robots.txt vs llms.txt: qué hace cada uno

Estos dos archivos se confunden constantemente, y esa confusión lleva a malas políticas.

robots.txt gobierna el acceso. Le dice a los crawlers qué rutas pueden pedir. Está estandarizado como IETF RFC 9309 y lo respetan todos los crawlers de IA bien educados mencionados arriba. Lo clave: es una petición voluntaria, no tiene fuerza legal y técnicamente no bloquea nada. Los bots que cumplen lo obedecen; los que se portan mal o falsifican su identidad, no.

llms.txt gobierna la navegación. Es una convención propuesta para listar tus páginas clave en un formato limpio y legible por modelos, para que encuentren tu mejor contenido de forma eficiente. Es una ayuda de descubrimiento, no un mecanismo de control de acceso. Ningún proveedor grande de IA se ha comprometido a tratarlo como una puerta. No uses llms.txt para intentar bloquear nada: no es para eso y no funcionará.

La conclusión práctica: usa robots.txt (respaldado por tu CDN) para el control, y trata llms.txt como un extra opcional para la navegación. Si quieres bloqueo real contra bots que no cumplen, necesitas bloqueo a nivel de servidor o CDN, porque robots.txt es un sistema de honor.

Un marco de decisión para tu política de crawlers de IA

Antes de tocar un archivo de configuración, decide tu postura. Este es el proceso de cuatro pasos que uso con clientes para fijar una política de crawlers de IA que encaje con su negocio en lugar de copiar la plantilla de otro.

Paso 1 — Clasifica tu contenido. ¿Tu contenido es el producto (una biblioteca de investigación de pago, datos propietarios, un curso) o el marketing (posts de blog, docs, páginas de producto que existen para atraer clientes)? El contenido de marketing suele querer máxima visibilidad en IA. El contenido-producto suele querer protección.

Paso 2 — Decide sobre los crawlers de búsqueda. Para casi todos, permite los crawlers de búsqueda y recuperación —OAI-SearchBot, Claude-SearchBot, PerplexityBot—. Son la vía para ganar citas en respuestas de IA. Bloquearlos rara vez es acertado, salvo que quieras apagarte a propósito.

Paso 3 — Toma una decisión deliberada sobre los crawlers de entrenamiento. Para GPTBot, ClaudeBot, CCBot y los tokens -Extended, elige según el Paso 1. ¿Proteges contenido premium? Bloquéalos. ¿Buscas alcance y te da igual que tu contenido entrene modelos? Permítelos. Es una decisión de negocio, no un valor por defecto técnico.

Paso 4 — Aplica y monitoriza. Pon la política en robots.txt, refléjala en el CDN para los bots que ignoran robots.txt, y luego revisa tus logs para confirmar que el comportamiento real coincide con tu intención. Una política sin verificación es una suposición.

Un valor por defecto defendible para la mayoría de pymes y empresas medianas: permite todos los crawlers de búsqueda, sal del entrenamiento de Google y Apple con Google-Extended y Applebot-Extended manteniendo intacta la inclusión en Search, y toma una decisión explícita y documentada sobre GPTBot, ClaudeBot y CCBot. Revisar esto es parte natural de cualquier proyecto de SEO técnico moderno, junto a la eficiencia de rastreo y la indexación.

Implementar el control de crawlers de IA en robots.txt

Una vez fijada tu política, la implementación es directa. Este es un robots.txt de partida que refleja el valor por defecto anterior —permitir búsqueda, salir del entrenamiento—:

# Permitir crawlers de búsqueda de IA (elegibles para citas)
User-agent: OAI-SearchBot
Allow: /

User-agent: Claude-SearchBot
Allow: /

User-agent: PerplexityBot
Allow: /

# Salir del entrenamiento de IA de Google y Apple (Search intacto)
User-agent: Google-Extended
Disallow: /

User-agent: Applebot-Extended
Disallow: /

# Bloquear crawlers de entrenamiento de modelos
User-agent: GPTBot
Disallow: /

User-agent: ClaudeBot
Disallow: /

User-agent: CCBot
Disallow: /

Ajusta el bloque de entrenamiento según tu decisión del Paso 3. Si quieres que tu contenido entrene modelos para máximo alcance, cambia esas líneas Disallow: / por Allow: /.

Dos reglas de implementación que despistan a mucha gente. Primera: Google-Extended y Applebot-Extended son tokens de exclusión de entrenamiento, no crawlers —no afectan a Googlebot ni a la indexación normal en Search, así que bloquearlos es seguro—. Segunda: recuerda que estas directivas se respetan, no se imponen. Para los bots que de verdad necesitas mantener fuera, añade una regla equivalente en tu CDN o firewall. Cloudflare, por ejemplo, ya ofrece bloqueo gestionado de crawlers de IA que actúa a nivel de red en vez de fiarse del sistema de honor.

Verifícalo antes de confiar en ello

Una política que no has verificado es un riesgo. Un estudio en la red de Cloudflare encontró que una parte notable de sitios bloqueaba por accidente a grandes crawlers de IA en el CDN mientras su robots.txt decía “permitir”: las dos capas contradiciéndose en silencio. Ese desajuste es invisible hasta que lo compruebas.

Haz esta ronda rápida de verificación tras cualquier cambio:

  1. Descarga tu propio robots.txt y léelo como lo haría un bot. Confirma que cada bloque de user-agent dice lo que pretendías y que no hay reglas Disallow: / globales perdidas por encima.
  2. Revisa tus logs de servidor o analítica buscando los user-agents de IA. ¿Los bots que permitiste reciben 200, y los que bloqueaste reciben 403 o no aparecen? El análisis de logs es la verdad de campo aquí: la misma técnica del análisis de logs para crawl budget se aplica directamente a los bots de IA.
  3. Confirma que CDN y robots.txt coinciden. Si usas Cloudflare, Fastly o similar, comprueba que ninguna regla de WAF o bot-management bloquee a un crawler que tu robots.txt sí acoge, o al revés.
  4. Prueba tu visibilidad en IA. Haz a ChatGPT, Perplexity y Google una pregunta que tu contenido debería responder, y mira si te citan. Si desapareciste tras un cambio de configuración, probablemente bloqueaste un crawler de búsqueda por error.

Si prefieres que esto se audite en serio —acceso de rastreo, indexación y elegibilidad en búsqueda con IA revisados a la vez—, para eso está exactamente una auditoría SEO técnica.

Errores comunes que evitar

El patrón es siempre el mismo: buenas intenciones, instrumento tosco. Los errores que veo más a menudo:

  • Bloquear GPTBot y creer que saliste de la búsqueda de ChatGPT. Bloqueaste entrenamiento, no búsqueda. Si también quieres salir de la búsqueda de ChatGPT, eso es OAI-SearchBot: una decisión aparte.
  • Un User-agent: * / Disallow: / general para “la IA”. Eso bloquea también a Googlebot y destroza tu posicionamiento orgánico. Los crawlers de IA tienen user-agents específicos; apunta a ellos, nunca al comodín.
  • Confiar en robots.txt como bloqueo real. Es un sistema de honor. Los scrapers que no cumplen lo ignoran. Impón el bloqueo en el CDN para lo que importe.
  • Configurarlo una vez y olvidarlo. Aparecen crawlers nuevos constantemente: Bytespider era un bot menor hasta que escaló en 2026. Revisa tu política cada trimestre.

Dónde encaja el control de crawlers de IA en tu estrategia

El control de crawlers de IA ya es una parte permanente del SEO técnico, no algo puntual. La web ha cruzado el punto en que la mayoría de las peticiones a tu sitio vienen de máquinas, y una parte creciente son sistemas de IA decidiendo si entrenar contigo, citarte o ignorarte. Tratar ese tráfico como algo que gestionar a propósito —permitir los crawlers que aportan visibilidad, restringir los que solo extraen— es como proteges tu contenido y sigues presente en las respuestas de IA a la vez. Fija la política, aplícala en las dos capas, verifícala contra tus logs y revísala cada trimestre. Haz eso y el control de crawlers de IA deja de ser un riesgo y se convierte en una palanca que de verdad controlas.

Preguntas frecuentes

¿Bloquear GPTBot impide que mi contenido aparezca en ChatGPT?

No, y este es el error más común. GPTBot es el crawler de entrenamiento de OpenAI, mientras que OAI-SearchBot rastrea páginas para responder búsquedas en vivo de ChatGPT y puede citarte. Si bloqueas GPTBot renuncias al entrenamiento, pero deberías dejar OAI-SearchBot permitido para que ChatGPT siga mostrando y enlazando tus páginas. Bloquea el equivocado y desapareces de las respuestas de IA sin ganar nada.

¿Es suficiente robots.txt para bloquear crawlers de IA?

Para los bots que se comportan bien, sí. GPTBot, ClaudeBot y PerplexityBot documentan sus user-agents y respetan robots.txt, estandarizado como IETF RFC 9309. Pero robots.txt es una petición voluntaria sin fuerza legal, así que los bots que lo ignoran o falsifican su user-agent pasan igual. Si necesitas bloqueo real, hazlo en el servidor o el CDN, no solo en robots.txt.

¿Debo bloquear los crawlers de IA o permitirlos?

Para la mayoría de negocios, permite los crawlers de búsqueda y recuperación para seguir siendo elegible para citas en IA, y toma una decisión deliberada sobre los crawlers de entrenamiento según tu política de contenido. Los editores que protegen contenido premium suelen bloquear los bots de entrenamiento; las marcas que buscan visibilidad en IA suelen permitirlo todo. No hay respuesta universal: depende de si tu contenido es el producto o el marketing.

¿Qué es llms.txt y lo necesito?

llms.txt es un archivo propuesto que lista tus páginas más importantes en un formato limpio y legible para modelos, para ayudarles a navegar tu sitio. Gobierna la navegación, no el acceso: no es un mecanismo de control de acceso y ningún proveedor grande de IA se ha comprometido a respetarlo. Trátalo como una ayuda opcional de descubrimiento y confía en robots.txt y tu CDN para el control real.

¿Cada cuánto debo revisar mi política de crawlers de IA?

Cada trimestre es una cadencia sensata para la mayoría de sitios. Aparecen crawlers nuevos y los existentes cambian de comportamiento —Bytespider pasó de menor a primer nivel dentro de 2026—, así que una política fijada y olvidada queda desfasada rápido. Acompaña cada revisión con una comprobación rápida de logs para confirmar que los bots permitidos y bloqueados se comportan como esperas.

Ben — Consultor SEO Senior
Escrito por
Ben

Consultor SEO freelance senior con 15 años y más de 200 proyectos en 12 países. Trabajo directamente con empresas que quieren crecimiento orgánico real — sin agencias, sin juniors, sin relleno.

Deja un comentario

Tu email no se publicará. Sin spam, nunca.

Aplica esto
en tu sitio. Gratis.

Una auditoría técnica real. Sin compromiso, respuesta en 24 horas.