// Tool

Generador de robots.txt

Patrones de robots.txt listos para copiar para rastreadores de búsqueda y de IA: qué hacen realmente GPTBot, OAI-SearchBot, Google-Extended y ClaudeBot, y cómo verificar el acceso gratis.

Lo Que Esta Página Te Ofrece, Dicho Sin Rodeos

No hay ningún formulario en esta página que escupa un archivo robots.txt, y no lo necesitas. Un archivo robots.txt es un archivo de texto plano corto con una gramática pequeña y estable; cada herramienta generadora de internet produce el mismo puñado de patrones. Lo que de verdad falla con robots.txt nunca es la sintaxis. Es bloquear un rastreador que necesitabas, enviar a producción una regla de staging o creer que el archivo hace algo que no hace. Así que esta página te da las tres cosas que un generador no puede: el comportamiento documentado de cada token de rastreador, patrones de mínimo privilegio para copiar y adaptar, y una forma de verificar el archivo desplegado. Esa última parte es en directo y gratuita: el escaneo de visibilidad en IA de AEO Goal obtiene tu robots.txt real y reporta cuáles de 16 user agents de rastreadores de IA permite o bloquea actualmente, sin registro.

Cómo Funciona Realmente Robots.txt

El archivo vive en la raíz del host: https://tudominio.com/robots.txt. Se aplica solo a ese host. Un subdominio como docs.tudominio.com necesita su propio archivo, y http y https son técnicamente hosts distintos también. No existe tal cosa como un robots.txt para una subcarpeta.

Las reglas se agrupan por User-agent. Un rastreador encuentra el grupo que mejor coincide con su propio token y obedece solo ese grupo; si ningún grupo coincide, recurre a User-agent: *. Este es el detalle que pilla a los equipos que configuran el acceso de IA: en el momento en que creas un grupo User-agent: GPTBot, GPTBot ignora tu grupo * por completo, incluidas sus líneas Disallow, a menos que las repitas.

Dentro de un grupo, las líneas Disallow y Allow nombran prefijos de ruta. Cuando las reglas entran en conflicto, gana la regla más específica, es decir, la ruta coincidente más larga. Los motores principales también admiten * como comodín y $ para anclar el final de una URL. Una línea Sitemap: puede aparecer en cualquier parte del archivo y se aplica globalmente; es la forma de apuntar cada rastreador a tu sitemap XML sin esperar al descubrimiento.

Dos propiedades importan más que cualquier detalle de sintaxis. Primero, robots.txt es orientativo. El cumplimiento es voluntario; los rastreadores mayoritarios que se listan abajo documentan que lo obedecen, pero el archivo es una petición, no un control de acceso. Todo lo que sea genuinamente privado pertenece detrás de autenticación, no detrás de una línea Disallow. Segundo, robots.txt controla el rastreo, no la indexación. Google documenta que una URL bloqueada en robots.txt aún puede indexarse solo a partir de enlaces, sin su contenido. La consecuencia práctica es lo bastante contraintuitiva como para repetirla: para eliminar una página indexada, debes dejar que los rastreadores la obtengan para que puedan leer la directiva noindex. Bloquear la URL conserva el listado obsoleto.

Los Tokens De Rastreadores De IA Y Lo Que Hace Realmente Cada Uno

Cada token de abajo lo publica su proveedor. Esta tabla dice lo que cada proveedor documenta, nada más.

Token Operador Propósito documentado
GPTBot OpenAI Rastrea contenido que puede usarse para entrenar los modelos de OpenAI. Desautorizarlo excluye tu sitio de ese uso de entrenamiento.
OAI-SearchBot OpenAI Rastrea para mostrar y enlazar sitios en las funciones de búsqueda de ChatGPT. OpenAI documenta que no se usa para entrenar modelos. Bloquearlo te elimina de los resultados de búsqueda de ChatGPT.
ChatGPT-User OpenAI Obtiene una página en directo cuando la solicitud de un usuario de ChatGPT lo requiere. No es un rastreador masivo; cada obtención la inicia el usuario.
ClaudeBot Anthropic El rastreador web de Anthropic para recopilar contenido que puede mejorar sus modelos. Anthropic documenta por separado Claude-User para obtenciones iniciadas por el usuario y Claude-SearchBot para la indexación relacionada con la búsqueda.
PerplexityBot Perplexity Indexa páginas para la búsqueda y las respuestas de Perplexity. Bloquearlo te elimina del índice de Perplexity. Perplexity también documenta Perplexity-User para obtenciones hechas en nombre de un usuario.
Google-Extended Google No es un rastreador. Un token de control, leído por Googlebot, que rige si tu contenido se usa para el entrenamiento y el grounding del modelo Gemini. Desautorizarlo no afecta al rastreo, la indexación ni el posicionamiento en Google Search.
Bingbot Microsoft El rastreador de búsqueda de Bing. El índice de Bing también sustenta los resultados web de Microsoft Copilot, así que bloquear Bingbot tiene consecuencias más allá de los clásicos enlaces azules.
CCBot Common Crawl Construye el corpus de Common Crawl, un conjunto de datos abierto muy usado en el entrenamiento de modelos. Desautorizarlo te excluye de ese corpus de aquí en adelante.

El patrón que vale la pena interiorizar: estos tokens se ordenan en carriles, y cada carril tiene un coste diferente cuando se bloquea.

Un archivo robots.txt, tres tipos de lectores: rastreadores de entrenamiento como GPTBot y ClaudeBot, rastreadores de búsqueda y recuperación como OAI-SearchBot y PerplexityBot, y obtenedores iniciados por el usuario como ChatGPT-User, cada uno con un coste diferente cuando se bloquea

Bloquear el carril de entrenamiento es una decisión de política legítima sobre cómo se reutiliza tu contenido, y no perjudica tu visibilidad en las respuestas. Bloquear el carril de recuperación mientras intentas ganar citas de IA es autosabotaje: un motor no puede citar un corpus que le dijeron que no construyera. Bloquear el carril iniciado por el usuario significa que en el momento exacto en que un comprador pide a un asistente que lea tu página, el asistente no puede.

Patrones De Mínimo Privilegio Para Copiar

El principio es el mismo que en el control de acceso: permite lo que sirve a tus objetivos, deniega lo que no, y sé explícito sobre ambas cosas. Las páginas públicas de marketing y documentación deben ser legibles por cada rastreador de recuperación; las superficies de aplicación, API y admin no deben serlo por ninguno.

Patrón 1: abierto para la visibilidad, rutas privadas protegidas. Esta es la forma que usa el propio robots.txt de producción de AEO Goal, con grupos explícitos de rastreadores de IA para que la política sea visible y deliberada:

User-agent: GPTBot
User-agent: OAI-SearchBot
User-agent: ChatGPT-User
User-agent: ClaudeBot
User-agent: PerplexityBot
User-agent: Bingbot
Allow: /
Disallow: /app
Disallow: /api
Disallow: /admin

User-agent: *
Allow: /
Disallow: /app
Disallow: /api
Disallow: /admin

Sitemap: https://yourdomain.com/sitemap.xml

Fíjate en que las rutas privadas se repiten en ambos grupos. Esa es la regla de grupo nombrado de antes: un rastreador que coincide con el grupo de IA nunca lee el grupo *, así que cualquier Disallow que deba obligar a todos tiene que aparecer en cada grupo.

Patrón 2: excluirse del entrenamiento, seguir siendo recuperable. Para equipos cuya política es “no entrenéis con nuestro contenido, pero mantenednos en las respuestas”:

User-agent: GPTBot
User-agent: ClaudeBot
User-agent: CCBot
User-agent: Google-Extended
Disallow: /

User-agent: *
Allow: /
Disallow: /app
Disallow: /api
Disallow: /admin

Sitemap: https://yourdomain.com/sitemap.xml

OAI-SearchBot, PerplexityBot, Bingbot y Googlebot recurren al grupo * y siguen rastreando las páginas públicas, así que se conserva la visibilidad en búsqueda y en respuestas mientras se rechaza a los rastreadores de entrenamiento documentados.

Patrón 3: exclusión total de la IA. Añade los tokens de recuperación al grupo de disallow del patrón 2. Es una postura coherente para algunos negocios, pero nombra su coste con honestidad antes de enviarla: tus páginas quedan inelegibles para las respuestas generadas donde ocurre una parte creciente de la investigación del comprador, y tu visibilidad en IA baja a cero por tu propia mano. Que sea una decisión documentada, no una opción por defecto que alguien copió de una entrada de blog.

Errores Comunes

  • Tratar robots.txt como seguridad. El archivo es público y el cumplimiento es voluntario. /admin debería estar detrás de autenticación tanto si además está desautorizado como si no; la línea Disallow solo evita que los rastreadores que se portan bien malgasten presupuesto en redirecciones a tu página de inicio de sesión.
  • Bloquear una página que quieres desindexar. Ya se cubrió arriba, pero es el error de robots.txt más común de todos: Disallow impide que el rastreador vea siquiera tu noindex.
  • Dejar que una regla de staging llegue a producción. Disallow: / en un host de staging es correcto; las mismas dos líneas desplegadas en producción son una caída de visibilidad. Los archivos robots específicos por entorno deberían generarse en tiempo de build o de servicio, no editarse a mano.
  • Olvidar la anulación del grupo nombrado. Añadir User-agent: GPTBot / Allow: / para dar la bienvenida a un rastreador de IA exime silenciosamente a GPTBot de cada regla de tu grupo *. Repite los Disallow.
  • Bloquear recursos (assets). Desautorizar los directorios de CSS y JavaScript impide que los rastreadores que renderizan páginas vean la página como la ven los usuarios. Bloquea rutas privadas de la aplicación, no carpetas de recursos.
  • Suponer que un archivo cubre todos los subdominios. No lo hace. Audita www, el apex, docs, el blog y cualquier subdominio regional por separado.
  • Depender de Crawl-delay. Google lo ignora por completo; el soporte en otros sitios varía. La limitación de tasa pertenece a tu CDN o servidor, no a robots.txt.

Verificar El Archivo Que Realmente Enviaste

Un archivo robots.txt es sensible a las publicaciones: una sola línea descuidada elimina secciones enteras de un sitio del alcance de cada rastreador, y nada se rompe de forma visible. Así que la verificación, no la generación, es el paso que merece herramientas.

Para la vista de Google, el informe de robots.txt de Search Console muestra la versión que Googlebot obtuvo por última vez y señala problemas de análisis. No te dice nada sobre el carril de IA. Para eso, ejecuta el escaneo gratuito de visibilidad en IA: obtiene en directo tu robots.txt desplegado y tu página de inicio y reporta, agent por agent, para 16 user agents de rastreadores de IA, cuáles están permitidos y cuáles bloqueados, junto con comprobaciones de tu llms.txt, JSON-LD, etiquetas canonical y metadatos. Es un escaneo de una sola página, sin registro, y como robots.txt es un archivo de todo el sitio, sus hallazgos sobre robots se aplican a todo tu dominio. Ejecútalo antes de un cambio de robots para tener una referencia, y después del despliegue para confirmar que nada ha regresado.

Ese es también el límite honesto. El escaneo gratuito verifica el acceso desde fuera, bajo demanda. Detectar la regresión que no pensaste en comprobar, el preajuste de firewall que empezó a poner retos a PerplexityBot, la plantilla que se envió con un noindex perdido, es un trabajo de monitorización: dentro de la app, el rastreador del sitio y las auditorías técnicas recurrentes vuelven a comprobar según un calendario, y el seguimiento de citas de IA muestra si los motores que permitiste te están citando de verdad, que es la cifra a la que el archivo robots existe para servir.

Frequently asked questions

¿Hay un generador de robots.txt interactivo en esta página?

No. Esta página te da los patrones documentados para copiar y adaptar, que es lo que la mayoría de las herramientas generadoras producen de todos modos. Lo que AEO Goal sí ofrece en directo es la verificación: el escaneo gratuito de visibilidad en IA obtiene tu robots.txt real y reporta cuáles de 16 user agents de rastreadores de IA bloquea actualmente, sin registro.

¿Debería bloquear los rastreadores de IA en robots.txt?

Separa primero los dos carriles. Bloquear rastreadores de entrenamiento como GPTBot y ClaudeBot es una decisión de política defendible que no te elimina de las respuestas de IA. Bloquear rastreadores de recuperación como OAI-SearchBot, PerplexityBot y Bingbot elimina tus páginas de los índices de los que las respuestas generadas extraen sus citas, así que si la visibilidad en IA es un objetivo, deja ese carril abierto.

¿Bloquear una URL en robots.txt la elimina del índice de Google?

No, y puede hacer lo contrario. Una URL bloqueada en robots.txt aún puede indexarse a partir de los enlaces que apuntan a ella, solo que sin su contenido. Para desindexar una página, los rastreadores deben poder obtenerla y leer una directiva noindex, lo que significa que la URL no debe estar bloqueada en robots.txt.

No. Google documenta Google-Extended como un token de control, leído por Googlebot, que rige si tu contenido se usa para el entrenamiento y el grounding de Gemini. No es un rastreador aparte y desautorizarlo no tiene ningún efecto sobre el rastreo, la indexación ni el posicionamiento en Google Search.

¿Cómo pruebo un cambio de robots.txt antes y después de desplegarlo?

El informe de robots.txt de Google Search Console muestra el archivo que Google obtuvo por última vez y cualquier error de análisis para los rastreadores de Google. Para el carril de IA, ejecuta el escaneo gratuito de AEO Goal antes y después del despliegue: obtiene en directo tu robots.txt y reporta el estado de permitido frente a bloqueado para 16 user agents de IA, de modo que una regresión aparece de inmediato.

Ejecuta tu análisis gratuito en 60 segundos

Ejecuta un análisis gratuito para ver tu situación en ChatGPT, Claude, Gemini y Perplexity: qué respuestas te citan, cuáles citan a la competencia en tu lugar y qué corregir primero.

Run a free scan