Contáctenos

Elija país y ciudad

Nuestras oficinas en Estados Unidos

  • Nueva York
    Division Street 40, New York, 10002
    +1 (347) 620-09-02
  • Washington D. C.
    L Street Northwest 1200, Washington, 20005
    +1 (347) 620-09-02

GPTBot, ClaudeBot, PerplexityBot: qué rastreadores de IA permitir y cuáles bloquear

Sergey Carp de Nueva York, Cofundador / CTO

Hay una historia que vemos una y otra vez en las auditorías de visibilidad en IA. Una empresa dedica un año a invertir en contenido: artículos de expertos, páginas de servicios actualizadas, una sección de preguntas frecuentes bien hecha. Y, sin embargo, nunca aparece en las respuestas de ChatGPT ni de Perplexity. Abrimos el robots.txt y encontramos una regla que bloquea a todos los bots «desconocidos», añadida hace años para frenar a los scrapers. O el robots.txt está bien, pero la protección contra bots de la CDN o una regla de bloqueo geográfico rechaza las peticiones que llegan desde centros de datos en el extranjero, así que los rastreadores de OpenAI se quedan en la puerta. El sitio web existe, el contenido existe, pero para varios asistentes de IA sencillamente no está ahí.

También ocurre lo contrario. Un propietario descubre que GPTBot descarga sus artículos para entrenar modelos y, molesto, bloquea de golpe a todos los rastreadores de IA, incluidos los que le traen clientes. Veamos qué rastreadores de IA existen, en qué se diferencia un rastreador de entrenamiento de uno de búsqueda y cómo configurar el acceso para no perder ni su contenido ni sus clientes.

Lo esencial

Hay rastreadores de IA que entrenan, que indexan y que leen para el usuario. Admita los de búsqueda y usuario, decida sobre los de entrenamiento y revise su CDN.

Por qué la IA necesita visitar su sitio web

Cuando alguien pregunta a ChatGPT, Claude, Gemini o Perplexity «¿quién puede auditar las cuentas de un pequeño comercio electrónico?», recibe una respuesta de IA: un texto ya elaborado con recomendaciones, nombres de empresas y enlaces a los sitios web de origen. En los asistentes de chat, la respuesta llega dentro de la conversación con citas; en Google, aparece como un AI Overview (en español, «Resumen creado con IA») por encima de los resultados habituales. La gente lee la respuesta y, a menudo, elige directamente a partir de ella.

Para redactar esa respuesta, la IA tiene que leer páginas. Las páginas las descargan unos programas llamados rastreadores, o bots. Cada rastreador se identifica ante el servidor con un nombre, la cadena de user agent, y es ese nombre el que usan las reglas de robots.txt para permitirle o bloquearle el paso. Si el rastreador adecuado no puede abrir una página, la IA no puede citarla.

Tres tipos de rastreadores de IA: entrenamiento, búsqueda y peticiones de usuarios

Lo más importante que hay que entender: «el bot de la IA» no es un único bot. Las grandes empresas de IA tienen varios, y cada uno cumple una función distinta.

  • Los rastreadores de entrenamiento recopilan textos que pueden usarse para entrenar futuros modelos. Bloquearlos mantiene su contenido fuera de la «memoria» del modelo, pero normalmente no afecta a la búsqueda en tiempo real.
  • Los rastreadores de búsqueda indexan páginas para que la IA pueda encontrarlas y citarlas en sus respuestas. Si los bloquea, su sitio web desaparece de las respuestas con fuentes.
  • Los agentes que actúan a petición del usuario abren una página concreta cuando una persona en el chat pide «échale un vistazo a este sitio web», o cuando el asistente necesita consultar una página mientras responde. No se trata de un rastreo masivo, sino de una acción puntual en nombre de un usuario.

Para el sitio web de una empresa, la lógica es sencilla. Los rastreadores de búsqueda y los agentes que actúan a petición del usuario deberían estar permitidos casi siempre: traen menciones y visitas. Los rastreadores de entrenamiento pueden permitirse o bloquearse; es una decisión de política de empresa, no de marketing.

Lista de rastreadores de IA: quién es quién

Los nombres y las funciones de los rastreadores cambian de vez en cuando: las empresas añaden bots nuevos y precisan qué hacen los existentes. A continuación, el panorama en el momento de escribir este artículo. Antes de configurar nada, consulte la documentación para propietarios de sitios web que publica cada empresa.

Empresa Rastreador (user agent) Función Qué pasa si lo bloquea
OpenAI GPTBot Recopila datos para entrenar modelos El contenido no se usa para entrenamiento; la búsqueda de ChatGPT no se ve afectada
OpenAI OAI-SearchBot Búsqueda en ChatGPT Su sitio puede desaparecer de las respuestas de ChatGPT con enlaces
OpenAI ChatGPT-User Abre páginas a petición de un usuario ChatGPT no puede abrir su página cuando una persona se lo pide
Google Googlebot Indexación para la Búsqueda de Google, incluidos los AI Overviews Su sitio desaparece de la Búsqueda de Google y de los AI Overviews
Google Google-Extended (un token, no un rastreador aparte) Controla el uso del contenido para el entrenamiento y la fundamentación (grounding) de Gemini El contenido no se usa para esos fines; la Búsqueda de Google no se ve afectada
Anthropic ClaudeBot Recopila datos para entrenar modelos El contenido no se usa para entrenamiento
Anthropic Claude-SearchBot Búsqueda para las respuestas de Claude Su sitio puede aparecer con menos frecuencia en las respuestas de Claude con fuentes
Anthropic Claude-User Abre páginas a petición de un usuario Claude no puede abrir su página cuando una persona se lo pide
Perplexity PerplexityBot Indexación para la búsqueda de Perplexity Su sitio puede desaparecer de las respuestas de Perplexity
Perplexity Perplexity-User Abre páginas a petición de un usuario Por lo general no sigue robots.txt, así que un bloqueo en robots.txt puede no detenerlo
Microsoft Bingbot Indexación para Bing, en el que se basa Copilot Su sitio desaparece de Bing y de las respuestas de Copilot
Yandex YandexBot Indexación para la búsqueda de Yandex, en la que se basa Alice AI Su sitio desaparece de la búsqueda de Yandex y de las respuestas de Alice AI

Una aclaración sobre Google. Google-Extended no es un bot que visite su sitio; es un token que se usa en robots.txt. El rastreo lo sigue haciendo Googlebot, y el token solo indica a Google si su contenido puede utilizarse para el entrenamiento y la fundamentación de Gemini. No afecta a la Búsqueda de Google. Los AI Overviews se construyen sobre el índice de la Búsqueda de Google, así que no puede excluirse de ellos con Google-Extended, y bloquear Googlebot significa salir por completo de la Búsqueda de Google.

Una aclaración sobre los agentes que actúan a petición del usuario. Las empresas de IA a veces describen los bots que abren una página por petición directa de una persona como una acción del usuario y no como un rastreo automatizado, y las reglas de robots.txt pueden aplicarse a ellos de forma distinta que a los rastreadores habituales. Perplexity-User es un ejemplo. Si necesita restringir específicamente este tipo de acceso, consulte la documentación vigente de esa empresa y valore reglas a nivel de servidor.

GPTBot: ¿bloquearlo o no?

GPTBot es la pregunta que más oímos, porque es el rastreador de IA más conocido. La clave: GPTBot se encarga del entrenamiento, no de las respuestas con fuentes de ChatGPT. De la búsqueda se ocupa OAI-SearchBot, y de abrir páginas a petición del usuario, ChatGPT-User. El resto del panorama de ChatGPT lo tratamos en nuestra guía para lograr que ChatGPT recomiende su negocio.

Quedan, por tanto, tres opciones deliberadas:

  • Permitir a todos. Lo adecuado para la mayoría de las empresas de servicios y tiendas online: cuanto más sepa la IA sobre su empresa, mejor. Estos sitios web rara vez contienen datos únicos que merezca la pena proteger.
  • Bloquear el entrenamiento, permitir la búsqueda. Conviene a editores, creadores de contenido de pago y propietarios de bases de datos o metodologías únicas. Se bloquean GPTBot, ClaudeBot y Google-Extended; se permiten los rastreadores de búsqueda y los agentes que actúan a petición del usuario.
  • Bloquear todo salvo la búsqueda tradicional. Puede tener sentido en portales corporativos privados. Para un sitio web que necesita clientes, es casi siempre un error.

En los registros de su servidor, el user agent de GPTBot es una cadena que contiene la palabra GPTBot y un enlace a una página que describe el rastreador. Cualquier script puede falsificar esa cadena, así que, en caso de duda, verifique las peticiones con los rangos de IP publicados. OpenAI y otras empresas de IA los publican.

Cómo bloquear rastreadores de IA en robots.txt: ejemplos

En cada ejemplo, example.com es un marcador de posición; sustituya las secciones de servicio (área de clientes, carrito, buscador interno) por las suyas.

Ejemplo 1. Permitir a todos, bloquear las secciones de servicio

User-agent: *
Disallow: /account/
Disallow: /cart/
Disallow: /search/

Sitemap: https://example.com/sitemap.xml

La opción más sencilla. No hay grupos separados para los rastreadores de IA, así que todos siguen el grupo general marcado con un asterisco.

Ejemplo 2. Bloquear el entrenamiento, permitir la búsqueda y las peticiones de usuarios

# Rastreadores de entrenamiento: bloqueados
User-agent: GPTBot
Disallow: /

User-agent: ClaudeBot
Disallow: /

User-agent: Google-Extended
Disallow: /

# Rastreadores de búsqueda y agentes a petición del usuario: permitidos, salvo las secciones de servicio
User-agent: OAI-SearchBot
User-agent: ChatGPT-User
User-agent: Claude-SearchBot
User-agent: Claude-User
User-agent: PerplexityBot
User-agent: Perplexity-User
Disallow: /account/
Disallow: /cart/
Disallow: /search/

# Todos los demás, incluidos Googlebot, Bingbot y YandexBot
User-agent: *
Disallow: /account/
Disallow: /cart/
Disallow: /search/

Sitemap: https://example.com/sitemap.xml

Aquí hay un detalle técnico en el que la gente se equivoca con más frecuencia. Un rastreador busca en robots.txt un grupo con su propio nombre y, si lo encuentra, ignora el grupo general del asterisco. Por eso las reglas de las secciones de servicio deben repetirse en cada grupo con nombre. De lo contrario, el área de clientes queda cerrada para todos excepto para OAI-SearchBot.

Ejemplo 3. Un error habitual

User-agent: *
Disallow: /

User-agent: Googlebot
Allow: /

Así se ve «bloquear a todos menos a Google». El sitio web sigue en Google, pero queda completamente cerrado a los rastreadores que hay detrás de ChatGPT, Claude y Perplexity, y a Bingbot, lo que significa que también a Copilot. Nos encontramos archivos así con regularidad, y los propietarios normalmente ni siquiera recuerdan que existen.

¿Y llms.txt en robots.txt?

No existe ninguna directiva de robots.txt para llms.txt, así que no necesita hacer referencia a él: el archivo se encuentra en su dirección estándar, example.com/llms.txt. Solo asegúrese de que robots.txt no bloquee el acceso a él. Qué escribir en el propio archivo lo explicamos en nuestra guía completa de llms.txt.

Cortafuegos, CDN y protección contra bots: el bloqueo invisible

robots.txt es una petición, no una cerradura. La cerradura de verdad está en su servidor o delante de él, y a menudo detiene precisamente a los bots que usted quería dejar pasar. Los culpables más habituales:

  • Los interruptores «Bloquear bots de IA» de su CDN. Algunas CDN y servicios de seguridad ofrecen un ajuste de un solo clic que bloquea los rastreadores de IA conocidos, y puede venir activado por defecto en los proyectos nuevos. Estos interruptores no siempre distinguen los rastreadores de entrenamiento de los de búsqueda.
  • Protección DDoS y desafíos de navegador. Un rastreador no puede superar un desafío de JavaScript ni un CAPTCHA, y recibe una página de verificación en lugar de su contenido.
  • Bloqueo geográfico. Las empresas que solo atienden a un país a veces bloquean el tráfico del resto del mundo. Los rastreadores de IA suelen funcionar desde centros de datos en otros países y también quedan rechazados.
  • Limitación de frecuencia. Un rastreador que solicita varias páginas seguidas alcanza el límite y recibe un código de estado 429.
  • Cortafuegos de aplicaciones web y plugins de seguridad. Los módulos de seguridad de WordPress y de otros CMS, así como los cortafuegos del hosting, bloquean user agents «sospechosos» según sus propias listas.

La solución no es desactivar la protección, sino añadir los rastreadores adecuados a la lista de permitidos, idealmente verificados por sus rangos de IP publicados y no solo por el nombre. Así pasa el rastreador real, y un bot que se hace pasar por GPTBot no.

Cómo revisar los registros del servidor: quién visita y qué recibe

La única forma fiable de conocer la verdad es el registro de accesos de su servidor. Anota cada petición: URL, código de estado y user agent. Estos son algunos comandos para un servidor Linux con nginx. La ruta del registro en su servidor puede ser distinta.

# Cuántas peticiones hizo GPTBot
grep -ci "GPTBot" /var/log/nginx/access.log

# Qué códigos de estado recibe OAI-SearchBot
grep -i "OAI-SearchBot" /var/log/nginx/access.log | cut -d' ' -f9 | sort | uniq -c

# Qué páginas solicitó PerplexityBot
grep -i "PerplexityBot" /var/log/nginx/access.log | cut -d' ' -f7 | sort | uniq -c | sort -rn | head -20

Cómo interpretar los resultados:

  • Ninguna petición: el rastreador aún no ha visitado el sitio, o se le bloquea antes de llegar a su servidor, a nivel de la CDN. Revise los registros de su CDN.
  • Códigos de estado 200: todo bien, el rastreador recibe sus páginas.
  • Códigos de estado 403, 429 o 503: el rastreador llega, pero se le rechaza. Busque la causa en la configuración de su protección.
  • Muchos códigos 301 y 404: el rastreador pierde tiempo en redirecciones y enlaces rotos. Es hora de poner orden.

Si no tiene acceso al servidor, por ejemplo con un creador de sitios web alojado, los informes de rastreo de Google Search Console y Bing Webmaster Tools ayudan en parte, pero no le dicen nada sobre los rastreadores de IA. En ese caso, consulte al equipo de soporte de su plataforma.

Configuración del acceso paso a paso

Paso Qué hacer Cuándo
1. Política Decida si permite los rastreadores de entrenamiento y déjelo por escrito como política de la empresa Una vez
2. Auditoría de robots.txt Compruebe si hay bloqueos a Googlebot, Bingbot y los rastreadores de búsqueda de IA Una vez y, después, tras cada actualización del sitio
3. Reescritura de robots.txt Siga uno de los ejemplos anteriores, repitiendo las reglas de las secciones de servicio en cada grupo Una vez
4. Revisión de la protección Revise la configuración de la CDN, la protección DDoS, el bloqueo geográfico, el cortafuegos y los plugins de seguridad Una vez y, después, al cambiar de hosting o de CDN
5. Lectura de los registros Compruebe qué rastreadores visitaron el sitio y qué códigos de estado recibieron Entre una y dos semanas después de los cambios y, después, cada mes

El acceso de los rastreadores es el primer bloque de nuestro checklist de posicionamiento en IA. Sin él, nada más de la lista importa.

El resultado: su sitio web abierto a los bots que traen clientes

Una vez configurado el acceso, la situación pasa a estar bajo control. Los rastreadores de búsqueda reciben las páginas con un código de estado 200, las secciones de servicio están cerradas para todos, la decisión sobre el entrenamiento de modelos es deliberada y consta en robots.txt, y su protección deja pasar a los rastreadores verificados mientras detiene a los falsos. Esto no garantiza un lugar en las respuestas de la IA, pero elimina el motivo más frustrante para no aparecer en ellas: «sencillamente, no pudieron entrar».

Cómo nos ocupamos del acceso de los rastreadores de IA y de todo lo demás

En Posicionamiento en IA hacemos SEO desde 2002. Tenemos más de 100 clientes en todo el mundo, certificaciones de Google y Yandex y un solo equipo que se ocupa de principio a fin de su sitio web y de su visibilidad en IA. Optimizamos para Google AI Overviews y AI Mode, ChatGPT, Gemini, Claude, Perplexity, Microsoft Copilot y otros asistentes de IA, para empresas en Nueva York y en mercados internacionales.

La configuración del acceso de los rastreadores de IA forma parte de las mejoras técnicas del sitio web. El servicio completo incluye:

  • una auditoría de visibilidad en IA: robots.txt, protección del servidor, registros y lo que los asistentes de IA dicen de usted y de sus competidores;
  • investigación de prompts: las preguntas que sus clientes hacen a los asistentes de IA;
  • mejoras técnicas en el sitio web: acceso de los rastreadores de IA, llms.txt, marcado Schema, velocidad, errores;
  • contenido nuevo pensado para las respuestas de la IA;
  • menciones de marca en sitios de terceros;
  • publicación de artículos en fuentes externas para reforzar la autoridad de su empresa y de sus expertos;
  • seguimiento continuo de la visibilidad en IA.

La IA evalúa su sitio web en su conjunto, así que nos ocupamos de todo el sitio desde el primer día, de las mejoras técnicas al GEO. Garantizamos la ejecución de las tareas de GEO, la corrección de errores y la adaptación rápida de su sitio web a los requisitos cambiantes de la búsqueda con IA, incluidos los nuevos rastreadores a medida que aparezcan.

La tarifa mensual es de 290 USD al mes, con las primeras 10 horas de trabajo incluidas. Cada hora adicional cuesta 45 USD. El trabajo de GEO se factura por horas trabajadas: solo facturamos el trabajo realizado y entregado ese mes. Sin descuentos ni meses gratis.

Agende una llamada. Averiguaremos qué rastreadores está rechazando ahora mismo su sitio web y lo abriremos a los asistentes de IA que de verdad usan sus clientes.

Más artículos

Posicionamiento en IA: cómo lograr que ChatGPT, Google AI Overviews y Perplexity recomienden su negocio

La IA recomienda negocios que puede encontrar, entender y en los que confía. El posicionamiento en IA hace que citen su sitio y nombren a su empresa.

Leer el artículo

¿Qué es la optimización para motores generativos (GEO)? GEO frente a SEO, explicado para empresarios

GEO, AEO, LLMO y SEO para IA persiguen lo mismo: que la IA recomiende su negocio. El GEO se construye sobre el SEO; uno no funciona sin el otro.

Leer el artículo

Agende una llamada con un especialista en posicionamiento en IA

Le mostraremos qué dicen ChatGPT, Google AI Overviews, Perplexity y otros asistentes de IA sobre su negocio y sobre sus competidores, y qué hay que cambiar en su sitio web y fuera de él.

Nueva York, Estados Unidos

Shark Chelsea

Division Street 40, New York, 10002, Nueva York

+1 (347) 620-09-02

united-states-new-york-city-es@promo-yar.ru