// Resource

SEO técnico y preparación para AEO: módulo 4 del curso

Aprende las comprobaciones técnicas que deciden si los rastreadores de búsqueda y de IA pueden obtener, renderizar y extraer tus páginas: robots.txt para agentes de IA, canónicas, sitemaps, respuestas estáticas, estructura de encabezados y datos estructurados honestos.

Qué vas a aprender

Al terminar este módulo serás capaz de:

  • Auditar robots.txt para los rastreadores de IA que alimentan cada motor de respuesta, y saber qué agente controla qué superficie.
  • Verificar canónicas, inclusión en el sitemap y visibilidad de la respuesta estática con comandos, no con suposiciones.
  • Estructurar los encabezados para que un extractor pueda extraer tu respuesta con limpieza.
  • Escribir JSON-LD honesto y saber cuándo dejar una página sin schema por completo.
  • Diagnosticar el caso clásico: una página que posiciona en Google pero nunca aparece como cita de IA.

El módulo 3 te dio un mapa de páginas. Este módulo verifica que cada URL de ese mapa puede competir físicamente antes de que inviertas tiempo de redacción en ella.

Por qué “posiciona bien” no significa “elegible para citas”

La elegibilidad en Google y la elegibilidad en los motores de respuesta se solapan, pero no son la misma prueba. Las funciones de IA de Google reutilizan la elegibilidad ordinaria de la Búsqueda: si Googlebot puede rastrearte e indexarte, puedes aparecer en Google AI Overviews.

Cómo una página se vuelve elegible para las funciones de IA de Google: rastreable por Googlebot, indexable, extraíble, sin una vía de envío específica para IA

Otros motores ejecutan sus propios rastreadores con sus propias identidades en robots.txt, así que una página puede estar perfectamente sana para Google y ser invisible para ChatGPT. Y cada motor añade un requisito de extracción por encima del rastreo: la respuesta debe existir como texto limpio, estático y extraíble. Eso te deja tres clases de fallo independientes: acceso (un rastreador está bloqueado), salud de indexación (canónica incorrecta, noindex, ausencia en el sitemap) y extractibilidad (la respuesta necesita JavaScript, interacción o un inicio de sesión para existir). La comprobación de preparación de más abajo las recorre en orden.

La comprobación de preparación de siete puntos

1. Acceso de los rastreadores de IA. Cada motor se anuncia con un user agent documentado, y una sola línea de robots.txt puede eliminarte en silencio de toda una superficie de respuestas. Los que más importan:

User agent Operador Controla
Googlebot Google Índice de búsqueda, que también alimenta AI Overviews
Google-Extended Google Si tu contenido fundamenta a Gemini
GPTBot OpenAI Recopilación de datos de entrenamiento
OAI-SearchBot OpenAI Respuestas de búsqueda de ChatGPT
ClaudeBot Anthropic Índice web de Claude
PerplexityBot Perplexity Índice de Perplexity
Bingbot Microsoft Bing, que también alimenta Copilot

OpenAI documenta sus tres agentes en platform.openai.com/docs/bots; la lista completa de Google está en el resumen de rastreadores. Comprueba tu archivo con cada nombre. El fallo clásico es un bloqueo de 2023 de todos los agentes de IA que nadie ha vuelto a revisar desde entonces.

2. Respuesta y canónica. Ejecuta curl -I sobre la URL: un solo 200, sin cadena de redirecciones. Después comprueba que la etiqueta canónica apunta a la propia página (o al padre previsto). Una canónica que apunta a otro sitio le dice a cada motor “no me indexes, atribúyelo a esa otra URL”, lo cual es correcto para duplicados reales y catastrófico cuando una plantilla lo aplica por accidente. La guía de consolidación de duplicados de Google explica la lógica de selección.

3. Inclusión en el sitemap. Cada página canónica de tu mapa pertenece al sitemap XML; las URL redirigidas, con noindex y no canónicas no. Un sitemap lleno de URL basura desperdicia la atención de rastreo en páginas que no quieres servir.

4. Visibilidad de la respuesta estática. Consulta el código fuente (el HTML en bruto, no el DOM renderizado) y busca la primera frase de tu respuesta. Si no está, tu respuesta solo existe después de que se ejecute el JavaScript, y estás apostando a que todos los rastreadores ejecutan tu JS. Googlebot renderiza JavaScript; la mayoría de los rastreadores de IA obtienen el HTML en bruto. Renderiza en el servidor cualquier cosa que quieras que se cite.

5. Estructura de encabezados. La extracción funciona por secciones. Un solo H1 que enuncie el tema, luego H2 formulados como las preguntas que hacen los compradores, cada uno seguido inmediatamente por su respuesta:

<h1>AI Citation Tracking</h1>

<h2>What is AI citation tracking?</h2>
<p>AI citation tracking records which URLs ChatGPT, Claude, Gemini,
and Perplexity cite when answering buyer questions, so teams can see
whether their pages or their competitors' pages are the source.</p>

<h2>How often should you re-check citations?</h2>
<p>...</p>

Un H2 en forma de pregunta con una respuesta completa de dos frases justo debajo es la unidad más fácil de extraer que hay en la web. Enterrar la respuesta cuatro párrafos por debajo de su encabezado renuncia a esa ventaja.

6. Datos estructurados que coinciden con el contenido visible. El JSON-LD hace que el significado de tu página sea legible por máquinas: qué es la entidad, quién la publica, qué preguntas responde. Un bloque de FAQ honesto tiene este aspecto:

<script type="application/ld+json">
{
  "@context": "https://schema.org",
  "@type": "FAQPage",
  "mainEntity": [{
    "@type": "Question",
    "name": "What is AI citation tracking?",
    "acceptedAnswer": {
      "@type": "Answer",
      "text": "AI citation tracking records which URLs AI answer engines cite when answering buyer questions."
    }
  }]
}
</script>

La regla de hierro, directamente de las directrices de datos estructurados de Google: el marcado debe describir contenido visible en la página. El schema es una etiqueta, no una palanca; etiquetar contenido que la página no contiene arriesga acciones manuales y erosiona precisamente la confianza de las máquinas que intentas construir. Valida con validator.schema.org y la Prueba de resultados enriquecidos de Google. Consulta el glosario de datos estructurados para ver las definiciones de tipos.

7. Enlaces internos. Ya cubiertos mecánicamente en el módulo 1; la pregunta de preparación aquí es la cobertura. Cada URL de tu mapa de páginas debería ser accesible en tres clics y estar enlazada con anclas descriptivas desde al menos otras dos páginas relevantes.

Ejemplo trabajado: posiciona en Google, invisible para ChatGPT

Un equipo de SaaS observa que su guía de integración posiciona en la primera página para su palabra clave, pero nunca aparece en las respuestas de búsqueda de ChatGPT, donde la guía inferior de un competidor se cita constantemente. Recorriendo las comprobaciones en orden:

  1. curl -I devuelve 200. Correcto.
  2. robots.txt: User-agent: OAI-SearchBot / Disallow: / está en un bloque añadido durante un sprint de 2023 de “bloquear a los rastreadores de IA”, por debajo de un bloque de permiso total para *. Las reglas de agente específico anulan el comodín. Fallo, y esto por sí solo explica el síntoma.
  3. La canónica se autorreferencia. Correcto.
  4. Código fuente: los pasos de la guía están en el HTML estático. Correcto.
  5. Encabezados: el H1 es el eslogan de la marca y la pregunta real es un H3 a mitad de página. Débil, vale la pena arreglarlo, pero secundario.

La solución es borrar dos líneas de robots.txt más una limpieza de encabezados, no la reescritura de contenido para la que el equipo había presupuestado un sprint. Esta es la recompensa de diagnosticar en orden: la primera comprobación que falla suele ser toda la historia, y suele ser barata.

La versión de cinco capas de este diagnóstico, específica para ChatGPT, tiene este aspecto:

Las cinco capas de elegibilidad como fuente en ChatGPT: acceso del rastreador, inclusión en el índice, recuperación, extracción y citación, donde una cita ausente es un fallo en exactamente una capa

Ejercicio: audita una página del mapa

Toma la URL comercialmente más importante de tu mapa del módulo 3. Presupuesta una hora.

  1. Obtén https://yoursite.com/robots.txt y compáralo con los siete user agents de la tabla de arriba. Registra cualquier bloqueo y si es intencionado.
  2. Ejecuta curl -I sobre la URL. Registra el estado y cualquier salto de redirección.
  3. Consulta el código fuente. Confirma que la canónica se autorreferencia, que la etiqueta meta robots no dice noindex y que la primera frase de la respuesta que pretendes dar aparece en el HTML en bruto.
  4. Confirma que la URL está en tu sitemap e inspecciónala en Google Search Console.
  5. Copia el esquema de tus encabezados (H1, H2) en un documento. Pregúntate: ¿podría un desconocido reconstruir las preguntas de la página solo a partir de los H2? Reescribe cualquier encabezado que no lo supere.
  6. Si la página tiene schema, pégalo en validator.schema.org y verifica que cada afirmación es visible en la página. Si no tiene ninguno, decide si Article, FAQPage o SoftwareApplication encaja honestamente, o si la respuesta honesta es ninguno.
  7. Escribe el resultado como una nota de tres columnas: problema, impacto, responsable. Cualquier cosa de las clases de acceso o de indexación tiene prioridad sobre todo lo demás.

Una herramienta de auditoría de SEO técnico automatiza los pasos 1 a 4 en todo el sitio; hazlo a mano una vez para que la salida de la herramienta signifique algo para ti.

Errores comunes

  • Bloquear los rastreadores de IA y olvidarlo. Las dos líneas más caras de los archivos robots.txt modernos. Audita el archivo cada trimestre y después de cada sprint de “endurecimiento de seguridad”.
  • El schema como hechizo mágico. Marcar contenido que no es visible, o apilar seis tipos en una página, no hace nada que un extractor premie y arriesga penalizaciones.
  • Respuestas renderizadas en el cliente. Si tu respuesta necesita JavaScript para existir, parte de tu audiencia de máquinas nunca la ve.
  • Sitemap podrido. URL redirigidas y borradas que llevan años en el sitemap, diluyendo la atención de rastreo.
  • Reescribir contenido para arreglar un fallo técnico. Si la comprobación 1 o 2 falla, ninguna mejora de texto importa. El orden lo es todo.

Dónde lo automatiza AEO Goal

Las siete comprobaciones de arriba son exactamente lo que ejecuta el escaneo de visibilidad gratuito de AEO Goal del lado del servidor contra tu dominio: robots.txt en todos los agentes de IA, llms.txt, cobertura del sitemap, validez del JSON-LD, metadatos y saliencia de entidades, con cada hallazgo asociado a una solución concreta y ordenado por impacto. El bucle del agente es lo que más importa aquí: después de que despliegues la corrección de robots.txt o de schema, el siguiente escaneo la vuelve a comprobar, así que un problema resuelto sigue estando resuelto de forma verificable en lugar de regresar en silencio en el próximo despliegue.

Resumen y próximo módulo

Ahora puedes separar las tres clases de fallo (acceso, salud de indexación, extractibilidad), auditarlas todas con comandos reales y estructurar encabezados y schema para que las máquinas puedan extraer tus respuestas de forma honesta. La fontanería está verificada.

Lo que fluye por la fontanería es el contenido, y el contenido es donde la mayoría de los programas de AEO fallan en silencio. Continúa con Optimización de contenidos y briefs para convertir cada URL mapeada y auditada en una página que merezca ser citada.

Frequently asked questions

¿Qué comprobaciones técnicas importan para el AEO?

Las comprobaciones que deciden la elegibilidad para respuestas son el acceso de los rastreadores de IA en robots.txt (GPTBot, OAI-SearchBot, ClaudeBot, PerplexityBot, Google-Extended), una respuesta 200 estable, canónicas autorreferenciadas, la inclusión en el sitemap, la respuesta presente en el HTML estático, un H1 claro con H2 en forma de pregunta y datos estructurados que coincidan con el contenido visible.

¿Deberían los equipos añadir schema a todas las páginas?

No. Añade datos estructurados solo donde describan con precisión el contenido visible y encajen con el tipo de página. Un schema que afirma cosas que la página no dice de forma visible genera riesgo de confianza y puede desencadenar acciones manuales; por sí solo nunca gana citas.

¿Puede una página posicionar en Google pero nunca ser citada por los motores de IA?

Sí, y es habitual. Posicionar demuestra que Googlebot tiene acceso y que la indexación está sana; la citación requiere además que los rastreadores de IA estén permitidos, que la respuesta exista en HTML estático extraíble y que el pasaje responda por completo a la consulta. Cada condición falla de forma independiente, así que diagnostícalas en orden.

Ejecuta tu análisis gratuito en 60 segundos

Ejecuta un análisis gratuito para ver tu situación en ChatGPT, Claude, Gemini y Perplexity: qué respuestas te citan, cuáles citan a la competencia en tu lugar y qué corregir primero.

Run a free scan