Referencia · Rastreadores de IA

    Los nueve rastreadores de IA que leen su web, y qué cuesta bloquear cada uno

    La mayoría de los archivos robots.txt que auditamos se equivocan al menos en uno. Normalmente en el que saca al negocio, en silencio, de la búsqueda de ChatGPT.

    Actualizado 2026-08-29

    No existe un único «bot de IA». Hay al menos nueve rastreadores distintos de cuatro empresas, hacen trabajos diferentes, y bloquear uno no tiene ni de lejos la misma consecuencia que bloquear otro. El error más habitual que encontramos es un robots.txt que bloquea OAI-SearchBot cuando solo se pretendía renunciar al entrenamiento de modelos: una regla que saca por completo al negocio de las respuestas de búsqueda de ChatGPT sin hacer nada respecto al entrenamiento.

    El dato más importante: salvo Googlebot y Applebot, ninguno de estos rastreadores ejecuta JavaScript. Si su sitio construye el contenido en el navegador, ven una cáscara vacía diga lo que diga su robots.txt. Puede comprobar el suyo con nuestra herramienta gratuita de visibilidad en IA en aproximadamente un minuto.

    El título promete un coste, así que esta es la magnitud de lo que se bloquea. Adobe midió un aumento del 1.200 % en el tráfico que llega a las webs de comercio minorista de Estados Unidos desde fuentes de IA generativa en menos de un año. Semrush observó que el visitante medio procedente de la IA convierte 4,4 veces más que quien llega desde la búsqueda orgánica tradicional. BrightLocal cifra en un 45 % los consumidores que piden a la IA generativa recomendaciones de negocios locales, frente al 6 % de un año antes. Y el canal al que desplaza se está encogiendo: Pew Research siguió la navegación real y observó que la gente hace clic en un resultado el 8 % de las veces cuando hay un resumen de IA presente, frente al 15 % cuando no lo hay.

    Nada de eso es una proyección. Es el tamaño actual de un canal del que una sola línea equivocada en un archivo de texto puede excluirle por completo.

    GPTBot (OpenAI): solo entrenamiento de modelos

    GPTBot recoge datos que se usan para entrenar los modelos de OpenAI. No controla si aparece usted en los resultados de búsqueda de ChatGPT; de eso se ocupa otro bot.

    Bloquearlo es una decisión razonable sobre licencias de contenido y no le cuesta nada de visibilidad. El error es bloquearlo creyendo que controla la búsqueda de ChatGPT.

    En resumenBloquea el entrenamiento. No afecta a la visibilidad en la búsqueda de ChatGPT.

    OAI-SearchBot (OpenAI): la visibilidad en la búsqueda de ChatGPT

    Este es el que importa comercialmente. OAI-SearchBot construye el índice del que bebe la búsqueda de ChatGPT, y OpenAI documenta con claridad que los sitios que se excluyen «no se mostrarán en las respuestas de búsqueda de ChatGPT».

    Si después de leer esta página hace una sola cosa, confirme que su robots.txt permite OAI-SearchBot.

    En resumenBloquearlo le saca de las respuestas de búsqueda de ChatGPT. Casi nadie lo pretende.

    ChatGPT-User (OpenAI): peticiones en vivo durante una conversación

    Cuando alguien, dentro de una sesión de ChatGPT, sigue un enlace a su sitio o le pide al asistente que mire una página concreta, este es el agente que la solicita en tiempo real.

    Bloquearlo significa que a un usuario que le pide expresamente a ChatGPT que lea su página se le responde que no puede. Es una experiencia extraña que ofrecer a alguien que está investigándole activamente.

    En resumenBloquea la petición «ve y lee esta página» que ha iniciado una persona real.

    ClaudeBot (Anthropic): entrenamiento de modelos

    El rastreador de entrenamiento de Anthropic, equivalente directo de GPTBot. Se aplica el mismo razonamiento: bloquearlo es una decisión sobre licencias, no sobre visibilidad.

    En resumenBloquea el entrenamiento de Claude. Sin consecuencias para la visibilidad en búsqueda.

    Claude-SearchBot y Claude-User (Anthropic): la búsqueda de Claude y las peticiones en vivo

    Los equivalentes de Anthropic a OAI-SearchBot y ChatGPT-User: uno construye el índice de búsqueda que Claude consulta, el otro solicita una página cuando la conversación de un usuario lo requiere.

    La base de usuarios de Claude se inclina mucho hacia perfiles técnicos y profesionales, lo que para un negocio de servicios B2B supone una audiencia más valiosa por visita de lo que sugiere su cuota bruta de tráfico.

    En resumenBloquearlos le saca de las respuestas de Claude.

    PerplexityBot (Perplexity): el índice de respuestas de Perplexity

    Perplexity está diseñado para responder primero: muestra una respuesta compuesta con citas numeradas en lugar de una lista de enlaces, de modo que una cita allí resulta especialmente visible.

    No ejecuta JavaScript, así que un sitio renderizado en el cliente le resulta invisible por bueno que sea el contenido.

    En resumenBloquearlo le saca de las citas de Perplexity.

    Googlebot (Google): búsqueda, Vistas Generales de IA y modo IA

    Googlebot ejecuta JavaScript y es el único control que importa para las Vistas Generales de IA y el modo IA. No hay un «bot de Vistas Generales de IA» aparte que permitir o bloquear.

    Por eso el SEO clásico es el requisito de entrada a las superficies de IA de Google, y no una disciplina separada de ellas.

    En resumenBloquearlo le saca de Google Search y de las Vistas Generales de IA a la vez.

    Google-Extended: un token de robots.txt, no un rastreador

    Las agencias describen con frecuencia Google-Extended como una palanca sobre las Vistas Generales de IA. No es siquiera un rastreador: es un token que determina si su contenido entrena a Gemini.

    Google afirma explícitamente que «no afecta a la inclusión de un sitio en Google Search», y bloquearlo no le saca de las Vistas Generales de IA.

    En resumenBloquea solo el entrenamiento de Gemini. Sin efecto sobre Google Search ni las Vistas Generales de IA.

    Bingbot (Microsoft) y Applebot (Apple)

    Bingbot ejecuta JavaScript de forma imperfecta y alimenta a Bing, que a su vez alimenta parte de los resultados de búsqueda de ChatGPT: tiene, por tanto, una vía indirecta hacia un motor de respuesta.

    Applebot ejecuta JavaScript y da servicio a las superficies de Siri y Apple Intelligence.

    En resumenMerece la pena permitir ambos; los dos llegan más lejos que sus propios productos.

    El robots.txt que hace lo que casi todo el mundo quiere en realidad

    La intención habitual es: quedarse fuera del entrenamiento de modelos y quedarse dentro de las respuestas. Eso se puede expresar, porque entrenar y responder son rastreadores distintos. Permitir un bot es lo predeterminado, así que el archivo útil es el que nombra solo aquello a lo que usted se niega.

    Tres líneas rechazan a los recolectores de entrenamiento: Disallow: / bajo User-agent: GPTBot, lo mismo bajo User-agent: ClaudeBot y lo mismo bajo User-agent: Google-Extended. Nada más necesita una regla, porque permitir es lo predeterminado. Añada su línea de sitemap y pare ahí.

    Lo que eso deja libre para leerle es OAI-SearchBot, Claude-SearchBot, PerplexityBot, ChatGPT-User, Claude-User, Googlebot, Bingbot y Applebot, que es justo el conjunto que decide si puede llegar a ser citado.

    Si además quiere estar en el entrenamiento, la respuesta es más sencilla: no publique nada más que la línea de sitemap. El fallo que de verdad encontramos en las auditorías nunca es un archivo demasiado permisivo. Es un `User-agent: *` a secas con un `Disallow: /` olvidado de un entorno de pruebas, que atrapa de golpe a todos los bots de esta página.

    En resumenNombre solo aquello a lo que se niega. Bloquear el entrenamiento no exige bloquear a los rastreadores que responden.

    El patrón que atraviesa los nueve: los rastreadores que deciden si un asistente de IA puede citarle no son los que la mayoría cree, y los que más importan no saben ejecutar JavaScript. Arreglar el robots.txt es cosa de diez minutos. Arreglar el renderizado es un trabajo de ingeniería, y es exactamente para eso que existe nuestra práctica de AEO.

    Preguntas frecuentes

    ¿Qué rastreadores de IA ejecutan JavaScript?
    Solo Googlebot y Applebot renderizan JavaScript por completo. Bingbot lo hace de forma imperfecta. GPTBot, OAI-SearchBot, ChatGPT-User, ClaudeBot, Claude-SearchBot, Claude-User y PerplexityBot no lo ejecutan en absoluto, así que un sitio renderizado en el cliente les resulta invisible.
    ¿Bloquear GPTBot me saca de ChatGPT?
    No. GPTBot rige el entrenamiento de modelos. La visibilidad en la búsqueda de ChatGPT la controla OAI-SearchBot, un rastreador distinto con su propia directiva de robots.txt. Equivocarse de bot es el error más habitual que encontramos en las auditorías.
    ¿Cómo compruebo qué rastreadores permite hoy mi sitio?
    Lea directamente su robots.txt en sudominio.com/robots.txt y busque cada bot por su nombre, recordando que un simple «User-agent: *» con bloqueo los atrapa a todos de golpe. La vía más rápida es una comprobación automatizada, que además responde a lo que el robots.txt no puede: si queda algún contenido en la página una vez retirado el JavaScript.