GPTBot (OpenAI): solo entrenamiento de modelos
GPTBot recoge datos que se usan para entrenar los modelos de OpenAI. No controla si aparece usted en los resultados de búsqueda de ChatGPT; de eso se ocupa otro bot.
Bloquearlo es una decisión razonable sobre licencias de contenido y no le cuesta nada de visibilidad. El error es bloquearlo creyendo que controla la búsqueda de ChatGPT.
En resumenBloquea el entrenamiento. No afecta a la visibilidad en la búsqueda de ChatGPT.
OAI-SearchBot (OpenAI): la visibilidad en la búsqueda de ChatGPT
Este es el que importa comercialmente. OAI-SearchBot construye el índice del que bebe la búsqueda de ChatGPT, y OpenAI documenta con claridad que los sitios que se excluyen «no se mostrarán en las respuestas de búsqueda de ChatGPT».
Si después de leer esta página hace una sola cosa, confirme que su robots.txt permite OAI-SearchBot.
En resumenBloquearlo le saca de las respuestas de búsqueda de ChatGPT. Casi nadie lo pretende.
ChatGPT-User (OpenAI): peticiones en vivo durante una conversación
Cuando alguien, dentro de una sesión de ChatGPT, sigue un enlace a su sitio o le pide al asistente que mire una página concreta, este es el agente que la solicita en tiempo real.
Bloquearlo significa que a un usuario que le pide expresamente a ChatGPT que lea su página se le responde que no puede. Es una experiencia extraña que ofrecer a alguien que está investigándole activamente.
En resumenBloquea la petición «ve y lee esta página» que ha iniciado una persona real.
ClaudeBot (Anthropic): entrenamiento de modelos
El rastreador de entrenamiento de Anthropic, equivalente directo de GPTBot. Se aplica el mismo razonamiento: bloquearlo es una decisión sobre licencias, no sobre visibilidad.
En resumenBloquea el entrenamiento de Claude. Sin consecuencias para la visibilidad en búsqueda.
Claude-SearchBot y Claude-User (Anthropic): la búsqueda de Claude y las peticiones en vivo
Los equivalentes de Anthropic a OAI-SearchBot y ChatGPT-User: uno construye el índice de búsqueda que Claude consulta, el otro solicita una página cuando la conversación de un usuario lo requiere.
La base de usuarios de Claude se inclina mucho hacia perfiles técnicos y profesionales, lo que para un negocio de servicios B2B supone una audiencia más valiosa por visita de lo que sugiere su cuota bruta de tráfico.
En resumenBloquearlos le saca de las respuestas de Claude.
PerplexityBot (Perplexity): el índice de respuestas de Perplexity
Perplexity está diseñado para responder primero: muestra una respuesta compuesta con citas numeradas en lugar de una lista de enlaces, de modo que una cita allí resulta especialmente visible.
No ejecuta JavaScript, así que un sitio renderizado en el cliente le resulta invisible por bueno que sea el contenido.
En resumenBloquearlo le saca de las citas de Perplexity.
Googlebot (Google): búsqueda, Vistas Generales de IA y modo IA
Googlebot ejecuta JavaScript y es el único control que importa para las Vistas Generales de IA y el modo IA. No hay un «bot de Vistas Generales de IA» aparte que permitir o bloquear.
Por eso el SEO clásico es el requisito de entrada a las superficies de IA de Google, y no una disciplina separada de ellas.
En resumenBloquearlo le saca de Google Search y de las Vistas Generales de IA a la vez.
Google-Extended: un token de robots.txt, no un rastreador
Las agencias describen con frecuencia Google-Extended como una palanca sobre las Vistas Generales de IA. No es siquiera un rastreador: es un token que determina si su contenido entrena a Gemini.
Google afirma explícitamente que «no afecta a la inclusión de un sitio en Google Search», y bloquearlo no le saca de las Vistas Generales de IA.
En resumenBloquea solo el entrenamiento de Gemini. Sin efecto sobre Google Search ni las Vistas Generales de IA.
Bingbot (Microsoft) y Applebot (Apple)
Bingbot ejecuta JavaScript de forma imperfecta y alimenta a Bing, que a su vez alimenta parte de los resultados de búsqueda de ChatGPT: tiene, por tanto, una vía indirecta hacia un motor de respuesta.
Applebot ejecuta JavaScript y da servicio a las superficies de Siri y Apple Intelligence.
En resumenMerece la pena permitir ambos; los dos llegan más lejos que sus propios productos.
El robots.txt que hace lo que casi todo el mundo quiere en realidad
La intención habitual es: quedarse fuera del entrenamiento de modelos y quedarse dentro de las respuestas. Eso se puede expresar, porque entrenar y responder son rastreadores distintos. Permitir un bot es lo predeterminado, así que el archivo útil es el que nombra solo aquello a lo que usted se niega.
Tres líneas rechazan a los recolectores de entrenamiento: Disallow: / bajo User-agent: GPTBot, lo mismo bajo User-agent: ClaudeBot y lo mismo bajo User-agent: Google-Extended. Nada más necesita una regla, porque permitir es lo predeterminado. Añada su línea de sitemap y pare ahí.
Lo que eso deja libre para leerle es OAI-SearchBot, Claude-SearchBot, PerplexityBot, ChatGPT-User, Claude-User, Googlebot, Bingbot y Applebot, que es justo el conjunto que decide si puede llegar a ser citado.
Si además quiere estar en el entrenamiento, la respuesta es más sencilla: no publique nada más que la línea de sitemap. El fallo que de verdad encontramos en las auditorías nunca es un archivo demasiado permisivo. Es un `User-agent: *` a secas con un `Disallow: /` olvidado de un entorno de pruebas, que atrapa de golpe a todos los bots de esta página.
En resumenNombre solo aquello a lo que se niega. Bloquear el entrenamiento no exige bloquear a los rastreadores que responden.