1. Los rastreadores no pueden leer su página en absoluto
GPTBot, OAI-SearchBot, ClaudeBot, Claude-SearchBot y PerplexityBot no ejecutan JavaScript. Descargan su HTML y leen lo que haya dentro, y nada más.
Si su sitio arma el contenido en el navegador, que es lo que hacen por defecto la mayoría de los sitios en React, Vue y Angular, esos rastreadores reciben una página prácticamente vacía. Googlebot sí renderiza JavaScript y ve un sitio completo, así que sus posiciones siguen bien mientras usted es invisible para todos los asistentes. Nada en su analítica se lo informa, porque un rastreador que no encuentra nada tampoco le envía tráfico que usted pueda echar en falta.
Es una corrección de ingeniería y no de contenido: renderizado en servidor, generación estática o prerenderizado. No hay forma de escribir para salir de esto.
En resumenVea el código fuente, o desactive JavaScript y recargue. Si la página está vacía, deténgase aquí y arregle esto primero.
2. Su robots.txt está bloqueando al bot equivocado
La versión más común de este error es bloquear OAI-SearchBot creyendo que se está renunciando al entrenamiento de modelos. Son rastreadores distintos con funciones distintas: GPTBot recoge datos de entrenamiento y OAI-SearchBot alimenta la búsqueda de ChatGPT. Bloquear el segundo le saca por completo de las respuestas de ChatGPT sin hacer nada respecto al entrenamiento.
La misma trampa existe del lado de Anthropic, donde ClaudeBot entrena y Claude-SearchBot responde, y con Google-Extended, que es un identificador de robots.txt que rige el entrenamiento de Gemini y no un rastreador al que pueda bloquear el acceso a las Vistas Generales de IA.
Revise el archivo en lugar de fiarse de lo que recuerda. Estas reglas suelen haberlas añadido hace años alguien que ya no está, o vienen heredadas de una plantilla.
En resumenLea su robots.txt línea por línea. Los bots de entrenamiento y los de respuesta son distintos, y bloquear los de respuesta es un daño autoinfligido.
3. Nada en su sitio dice con claridad qué hace y dónde
Un asistente que responde a «quién hace esto cerca de mí» tiene que resolver su negocio como una entidad: un nombre, una categoría, una zona de servicio, una forma de contacto. Si esa información solo existe de forma implícita, en una imagen de portada o en un lema sobre pasión y excelencia, no hay nada que extraer.
La solución no tiene ningún glamur. Diga qué hace, para quién y en qué lugares, en frases claras, en una página que exista para responder a eso. Añada los datos estructurados que declaren esos mismos hechos sin ambigüedad para una máquina.
Este es el fallo de contenido más común, y suele deberse a un sitio escrito para impresionar a visitantes que ya saben a qué se dedica la empresa.
En resumenUna máquina no puede deducir su categoría a partir de su tono. Dígala.
4. Sus páginas no contienen respuestas que se puedan extraer
Los motores de respuesta recuperan pasajes, no páginas: normalmente un encabezado y el texto que hay debajo. Una página que solo tiene sentido leída de arriba abajo rinde mal, porque nunca se lee así.
En la práctica, eso significa encabezados formulados como la pregunta que haría de verdad un comprador, seguidos de una respuesta completa que sobreviva a ser leída de forma aislada. «Precios» es un encabezado para una persona que ya está desplazándose por la página. «¿Cuánto cuesta un servicio de atención de llamadas con IA?» es un encabezado que se recupera.
Si cada sección de su página necesita la anterior para tener sentido, lo que ha escrito es un folleto. A los folletos no se les cita.
En resumenEscriba los encabezados como preguntas y haga que cada sección se sostenga sola, porque se leerá sola.
5. No tiene pruebas, y aquí las pruebas son un factor de posicionamiento
El trabajo fundacional revisado por pares en este campo, el artículo GEO presentado en KDD 2024 por investigadores de Princeton y Georgia Tech, probó qué cambios en una página elevan la visibilidad en motores generativos. Tres tácticas produjeron cada una mejoras del orden del 30 al 40 %: añadir citas de fuentes, añadir extractos de fuentes creíbles y añadir estadísticas. El exceso de palabras clave rindió igual o peor que la línea base.
El mismo estudio encontró que las mejoras eran mayores en los sitios peor posicionados, lo que convierte a este en el raro canal donde un sitio pequeño y bien fundamentado puede citarse por delante de una página vaga de uno grande.
La trampa está en que las pruebas tienen que ser reales. Una estadística que no puede rastrear hasta quien la midió es un pasivo, no un activo, y ocupa justo el lugar en el que usted afirma tener autoridad.
En resumenCite, entrecomille y cuantifique. Y compruebe que cada cifra que usa se remonta a un estudio con nombre.
6. La fontanería de abajo está rota de una forma aburrida
Los errores 404 blandos, en los que una página inexistente devuelve un estado 200 con un mensaje de «no encontrado», le enseñan a un rastreador que toda URL de su sitio es válida. Las aplicaciones de una sola página los producen por defecto.
Y después, los problemas de descubrimiento de siempre: sin sitemap, o con uno que nunca se envió; páginas a las que no enlaza nada y que por tanto los rastreadores nunca alcanzan; etiquetas canónicas que apuntan a un lugar inesperado; una copia de pruebas compitiendo con producción.
Nada de esto es interesante y todo es frecuente. También es la categoría más barata de arreglar, lo que es una buena razón para revisarla antes de encargar contenido.
En resumenRevise los códigos de estado, el envío del sitemap y los enlaces internos. Los fallos aburridos siguen siendo fallos.