GPTBot, ClaudeBot, PerplexityBot: qué rastreadores de IA permitir y cuáles bloquear
Sergey Carp de Nueva York, Cofundador / CTO
Hay una historia que vemos una y otra vez en las auditorías de visibilidad en IA. Una empresa dedica un año a invertir en contenido: artículos de expertos, páginas de servicios actualizadas, una sección de preguntas frecuentes bien hecha. Y, sin embargo, nunca aparece en las respuestas de ChatGPT ni de Perplexity. Abrimos el robots.txt y encontramos una regla que bloquea a todos los bots «desconocidos», añadida hace años para frenar a los scrapers. O el robots.txt está bien, pero la protección contra bots de la CDN o una regla de bloqueo geográfico rechaza las peticiones que llegan desde centros de datos en el extranjero, así que los rastreadores de OpenAI se quedan en la puerta. El sitio web existe, el contenido existe, pero para varios asistentes de IA sencillamente no está ahí.
También ocurre lo contrario. Un propietario descubre que GPTBot descarga sus artículos para entrenar modelos y, molesto, bloquea de golpe a todos los rastreadores de IA, incluidos los que le traen clientes. Veamos qué rastreadores de IA existen, en qué se diferencia un rastreador de entrenamiento de uno de búsqueda y cómo configurar el acceso para no perder ni su contenido ni sus clientes.
Lo esencial
Hay rastreadores de IA que entrenan, que indexan y que leen para el usuario. Admita los de búsqueda y usuario, decida sobre los de entrenamiento y revise su CDN.
Por qué la IA necesita visitar su sitio web
Cuando alguien pregunta a ChatGPT, Claude, Gemini o Perplexity «¿quién puede auditar las cuentas de un pequeño comercio electrónico?», recibe una respuesta de IA: un texto ya elaborado con recomendaciones, nombres de empresas y enlaces a los sitios web de origen. En los asistentes de chat, la respuesta llega dentro de la conversación con citas; en Google, aparece como un AI Overview (en español, «Resumen creado con IA») por encima de los resultados habituales. La gente lee la respuesta y, a menudo, elige directamente a partir de ella.
Para redactar esa respuesta, la IA tiene que leer páginas. Las páginas las descargan unos programas llamados rastreadores, o bots. Cada rastreador se identifica ante el servidor con un nombre, la cadena de user agent, y es ese nombre el que usan las reglas de robots.txt para permitirle o bloquearle el paso. Si el rastreador adecuado no puede abrir una página, la IA no puede citarla.
Tres tipos de rastreadores de IA: entrenamiento, búsqueda y peticiones de usuarios
Lo más importante que hay que entender: «el bot de la IA» no es un único bot. Las grandes empresas de IA tienen varios, y cada uno cumple una función distinta.
- Los rastreadores de entrenamiento recopilan textos que pueden usarse para entrenar futuros modelos. Bloquearlos mantiene su contenido fuera de la «memoria» del modelo, pero normalmente no afecta a la búsqueda en tiempo real.
- Los rastreadores de búsqueda indexan páginas para que la IA pueda encontrarlas y citarlas en sus respuestas. Si los bloquea, su sitio web desaparece de las respuestas con fuentes.
- Los agentes que actúan a petición del usuario abren una página concreta cuando una persona en el chat pide «échale un vistazo a este sitio web», o cuando el asistente necesita consultar una página mientras responde. No se trata de un rastreo masivo, sino de una acción puntual en nombre de un usuario.
Para el sitio web de una empresa, la lógica es sencilla. Los rastreadores de búsqueda y los agentes que actúan a petición del usuario deberían estar permitidos casi siempre: traen menciones y visitas. Los rastreadores de entrenamiento pueden permitirse o bloquearse; es una decisión de política de empresa, no de marketing.
Lista de rastreadores de IA: quién es quién
Los nombres y las funciones de los rastreadores cambian de vez en cuando: las empresas añaden bots nuevos y precisan qué hacen los existentes. A continuación, el panorama en el momento de escribir este artículo. Antes de configurar nada, consulte la documentación para propietarios de sitios web que publica cada empresa.
| Empresa | Rastreador (user agent) | Función | Qué pasa si lo bloquea |
|---|---|---|---|
| OpenAI | GPTBot | Recopila datos para entrenar modelos | El contenido no se usa para entrenamiento; la búsqueda de ChatGPT no se ve afectada |
| OpenAI | OAI-SearchBot | Búsqueda en ChatGPT | Su sitio puede desaparecer de las respuestas de ChatGPT con enlaces |
| OpenAI | ChatGPT-User | Abre páginas a petición de un usuario | ChatGPT no puede abrir su página cuando una persona se lo pide |
| Googlebot | Indexación para la Búsqueda de Google, incluidos los AI Overviews | Su sitio desaparece de la Búsqueda de Google y de los AI Overviews | |
| Google-Extended (un token, no un rastreador aparte) | Controla el uso del contenido para el entrenamiento y la fundamentación (grounding) de Gemini | El contenido no se usa para esos fines; la Búsqueda de Google no se ve afectada | |
| Anthropic | ClaudeBot | Recopila datos para entrenar modelos | El contenido no se usa para entrenamiento |
| Anthropic | Claude-SearchBot | Búsqueda para las respuestas de Claude | Su sitio puede aparecer con menos frecuencia en las respuestas de Claude con fuentes |
| Anthropic | Claude-User | Abre páginas a petición de un usuario | Claude no puede abrir su página cuando una persona se lo pide |
| Perplexity | PerplexityBot | Indexación para la búsqueda de Perplexity | Su sitio puede desaparecer de las respuestas de Perplexity |
| Perplexity | Perplexity-User | Abre páginas a petición de un usuario | Por lo general no sigue robots.txt, así que un bloqueo en robots.txt puede no detenerlo |
| Microsoft | Bingbot | Indexación para Bing, en el que se basa Copilot | Su sitio desaparece de Bing y de las respuestas de Copilot |
| Yandex | YandexBot | Indexación para la búsqueda de Yandex, en la que se basa Alice AI | Su sitio desaparece de la búsqueda de Yandex y de las respuestas de Alice AI |
Una aclaración sobre Google. Google-Extended no es un bot que visite su sitio; es un token que se usa en robots.txt. El rastreo lo sigue haciendo Googlebot, y el token solo indica a Google si su contenido puede utilizarse para el entrenamiento y la fundamentación de Gemini. No afecta a la Búsqueda de Google. Los AI Overviews se construyen sobre el índice de la Búsqueda de Google, así que no puede excluirse de ellos con Google-Extended, y bloquear Googlebot significa salir por completo de la Búsqueda de Google.
Una aclaración sobre los agentes que actúan a petición del usuario. Las empresas de IA a veces describen los bots que abren una página por petición directa de una persona como una acción del usuario y no como un rastreo automatizado, y las reglas de robots.txt pueden aplicarse a ellos de forma distinta que a los rastreadores habituales. Perplexity-User es un ejemplo. Si necesita restringir específicamente este tipo de acceso, consulte la documentación vigente de esa empresa y valore reglas a nivel de servidor.
GPTBot: ¿bloquearlo o no?
GPTBot es la pregunta que más oímos, porque es el rastreador de IA más conocido. La clave: GPTBot se encarga del entrenamiento, no de las respuestas con fuentes de ChatGPT. De la búsqueda se ocupa OAI-SearchBot, y de abrir páginas a petición del usuario, ChatGPT-User. El resto del panorama de ChatGPT lo tratamos en nuestra guía para lograr que ChatGPT recomiende su negocio.
Quedan, por tanto, tres opciones deliberadas:
- Permitir a todos. Lo adecuado para la mayoría de las empresas de servicios y tiendas online: cuanto más sepa la IA sobre su empresa, mejor. Estos sitios web rara vez contienen datos únicos que merezca la pena proteger.
- Bloquear el entrenamiento, permitir la búsqueda. Conviene a editores, creadores de contenido de pago y propietarios de bases de datos o metodologías únicas. Se bloquean GPTBot, ClaudeBot y Google-Extended; se permiten los rastreadores de búsqueda y los agentes que actúan a petición del usuario.
- Bloquear todo salvo la búsqueda tradicional. Puede tener sentido en portales corporativos privados. Para un sitio web que necesita clientes, es casi siempre un error.
En los registros de su servidor, el user agent de GPTBot es una cadena que contiene la palabra GPTBot y un enlace a una página que describe el rastreador. Cualquier script puede falsificar esa cadena, así que, en caso de duda, verifique las peticiones con los rangos de IP publicados. OpenAI y otras empresas de IA los publican.
Cómo bloquear rastreadores de IA en robots.txt: ejemplos
En cada ejemplo, example.com es un marcador de posición; sustituya las secciones de servicio (área de clientes, carrito, buscador interno) por las suyas.
Ejemplo 1. Permitir a todos, bloquear las secciones de servicio
User-agent: *
Disallow: /account/
Disallow: /cart/
Disallow: /search/
Sitemap: https://example.com/sitemap.xml
La opción más sencilla. No hay grupos separados para los rastreadores de IA, así que todos siguen el grupo general marcado con un asterisco.
Ejemplo 2. Bloquear el entrenamiento, permitir la búsqueda y las peticiones de usuarios
# Rastreadores de entrenamiento: bloqueados
User-agent: GPTBot
Disallow: /
User-agent: ClaudeBot
Disallow: /
User-agent: Google-Extended
Disallow: /
# Rastreadores de búsqueda y agentes a petición del usuario: permitidos, salvo las secciones de servicio
User-agent: OAI-SearchBot
User-agent: ChatGPT-User
User-agent: Claude-SearchBot
User-agent: Claude-User
User-agent: PerplexityBot
User-agent: Perplexity-User
Disallow: /account/
Disallow: /cart/
Disallow: /search/
# Todos los demás, incluidos Googlebot, Bingbot y YandexBot
User-agent: *
Disallow: /account/
Disallow: /cart/
Disallow: /search/
Sitemap: https://example.com/sitemap.xml
Aquí hay un detalle técnico en el que la gente se equivoca con más frecuencia. Un rastreador busca en robots.txt un grupo con su propio nombre y, si lo encuentra, ignora el grupo general del asterisco. Por eso las reglas de las secciones de servicio deben repetirse en cada grupo con nombre. De lo contrario, el área de clientes queda cerrada para todos excepto para OAI-SearchBot.
Ejemplo 3. Un error habitual
User-agent: *
Disallow: /
User-agent: Googlebot
Allow: /
Así se ve «bloquear a todos menos a Google». El sitio web sigue en Google, pero queda completamente cerrado a los rastreadores que hay detrás de ChatGPT, Claude y Perplexity, y a Bingbot, lo que significa que también a Copilot. Nos encontramos archivos así con regularidad, y los propietarios normalmente ni siquiera recuerdan que existen.
¿Y llms.txt en robots.txt?
No existe ninguna directiva de robots.txt para llms.txt, así que no necesita hacer referencia a él: el archivo se encuentra en su dirección estándar, example.com/llms.txt. Solo asegúrese de que robots.txt no bloquee el acceso a él. Qué escribir en el propio archivo lo explicamos en nuestra guía completa de llms.txt.
Cortafuegos, CDN y protección contra bots: el bloqueo invisible
robots.txt es una petición, no una cerradura. La cerradura de verdad está en su servidor o delante de él, y a menudo detiene precisamente a los bots que usted quería dejar pasar. Los culpables más habituales:
- Los interruptores «Bloquear bots de IA» de su CDN. Algunas CDN y servicios de seguridad ofrecen un ajuste de un solo clic que bloquea los rastreadores de IA conocidos, y puede venir activado por defecto en los proyectos nuevos. Estos interruptores no siempre distinguen los rastreadores de entrenamiento de los de búsqueda.
- Protección DDoS y desafíos de navegador. Un rastreador no puede superar un desafío de JavaScript ni un CAPTCHA, y recibe una página de verificación en lugar de su contenido.
- Bloqueo geográfico. Las empresas que solo atienden a un país a veces bloquean el tráfico del resto del mundo. Los rastreadores de IA suelen funcionar desde centros de datos en otros países y también quedan rechazados.
- Limitación de frecuencia. Un rastreador que solicita varias páginas seguidas alcanza el límite y recibe un código de estado 429.
- Cortafuegos de aplicaciones web y plugins de seguridad. Los módulos de seguridad de WordPress y de otros CMS, así como los cortafuegos del hosting, bloquean user agents «sospechosos» según sus propias listas.
La solución no es desactivar la protección, sino añadir los rastreadores adecuados a la lista de permitidos, idealmente verificados por sus rangos de IP publicados y no solo por el nombre. Así pasa el rastreador real, y un bot que se hace pasar por GPTBot no.
Cómo revisar los registros del servidor: quién visita y qué recibe
La única forma fiable de conocer la verdad es el registro de accesos de su servidor. Anota cada petición: URL, código de estado y user agent. Estos son algunos comandos para un servidor Linux con nginx. La ruta del registro en su servidor puede ser distinta.
# Cuántas peticiones hizo GPTBot
grep -ci "GPTBot" /var/log/nginx/access.log
# Qué códigos de estado recibe OAI-SearchBot
grep -i "OAI-SearchBot" /var/log/nginx/access.log | cut -d' ' -f9 | sort | uniq -c
# Qué páginas solicitó PerplexityBot
grep -i "PerplexityBot" /var/log/nginx/access.log | cut -d' ' -f7 | sort | uniq -c | sort -rn | head -20
Cómo interpretar los resultados:
- Ninguna petición: el rastreador aún no ha visitado el sitio, o se le bloquea antes de llegar a su servidor, a nivel de la CDN. Revise los registros de su CDN.
- Códigos de estado 200: todo bien, el rastreador recibe sus páginas.
- Códigos de estado 403, 429 o 503: el rastreador llega, pero se le rechaza. Busque la causa en la configuración de su protección.
- Muchos códigos 301 y 404: el rastreador pierde tiempo en redirecciones y enlaces rotos. Es hora de poner orden.
Si no tiene acceso al servidor, por ejemplo con un creador de sitios web alojado, los informes de rastreo de Google Search Console y Bing Webmaster Tools ayudan en parte, pero no le dicen nada sobre los rastreadores de IA. En ese caso, consulte al equipo de soporte de su plataforma.
Configuración del acceso paso a paso
| Paso | Qué hacer | Cuándo |
|---|---|---|
| 1. Política | Decida si permite los rastreadores de entrenamiento y déjelo por escrito como política de la empresa | Una vez |
| 2. Auditoría de robots.txt | Compruebe si hay bloqueos a Googlebot, Bingbot y los rastreadores de búsqueda de IA | Una vez y, después, tras cada actualización del sitio |
| 3. Reescritura de robots.txt | Siga uno de los ejemplos anteriores, repitiendo las reglas de las secciones de servicio en cada grupo | Una vez |
| 4. Revisión de la protección | Revise la configuración de la CDN, la protección DDoS, el bloqueo geográfico, el cortafuegos y los plugins de seguridad | Una vez y, después, al cambiar de hosting o de CDN |
| 5. Lectura de los registros | Compruebe qué rastreadores visitaron el sitio y qué códigos de estado recibieron | Entre una y dos semanas después de los cambios y, después, cada mes |
El acceso de los rastreadores es el primer bloque de nuestro checklist de posicionamiento en IA. Sin él, nada más de la lista importa.
El resultado: su sitio web abierto a los bots que traen clientes
Una vez configurado el acceso, la situación pasa a estar bajo control. Los rastreadores de búsqueda reciben las páginas con un código de estado 200, las secciones de servicio están cerradas para todos, la decisión sobre el entrenamiento de modelos es deliberada y consta en robots.txt, y su protección deja pasar a los rastreadores verificados mientras detiene a los falsos. Esto no garantiza un lugar en las respuestas de la IA, pero elimina el motivo más frustrante para no aparecer en ellas: «sencillamente, no pudieron entrar».
Cómo nos ocupamos del acceso de los rastreadores de IA y de todo lo demás
En Posicionamiento en IA hacemos SEO desde 2002. Tenemos más de 100 clientes en todo el mundo, certificaciones de Google y Yandex y un solo equipo que se ocupa de principio a fin de su sitio web y de su visibilidad en IA. Optimizamos para Google AI Overviews y AI Mode, ChatGPT, Gemini, Claude, Perplexity, Microsoft Copilot y otros asistentes de IA, para empresas en Nueva York y en mercados internacionales.
La configuración del acceso de los rastreadores de IA forma parte de las mejoras técnicas del sitio web. El servicio completo incluye:
- una auditoría de visibilidad en IA: robots.txt, protección del servidor, registros y lo que los asistentes de IA dicen de usted y de sus competidores;
- investigación de prompts: las preguntas que sus clientes hacen a los asistentes de IA;
- mejoras técnicas en el sitio web: acceso de los rastreadores de IA, llms.txt, marcado Schema, velocidad, errores;
- contenido nuevo pensado para las respuestas de la IA;
- menciones de marca en sitios de terceros;
- publicación de artículos en fuentes externas para reforzar la autoridad de su empresa y de sus expertos;
- seguimiento continuo de la visibilidad en IA.
La IA evalúa su sitio web en su conjunto, así que nos ocupamos de todo el sitio desde el primer día, de las mejoras técnicas al GEO. Garantizamos la ejecución de las tareas de GEO, la corrección de errores y la adaptación rápida de su sitio web a los requisitos cambiantes de la búsqueda con IA, incluidos los nuevos rastreadores a medida que aparezcan.
La tarifa mensual es de 290 USD al mes, con las primeras 10 horas de trabajo incluidas. Cada hora adicional cuesta 45 USD. El trabajo de GEO se factura por horas trabajadas: solo facturamos el trabajo realizado y entregado ese mes. Sin descuentos ni meses gratis.
Agende una llamada. Averiguaremos qué rastreadores está rechazando ahora mismo su sitio web y lo abriremos a los asistentes de IA que de verdad usan sus clientes.