Generador de robots.txt

Monta tu robots.txt bloque a bloque: reglas Allow y Disallow por rastreador, crawl delay, sitemaps y comentarios, con vista previa en vivo.

El archivo se construye localmente en tu navegador. Nada sale de tu dispositivo.

Sitemaps

Una línea «Sitemap:» por cada mapa XML; mejor siempre con la URL absoluta completa.

Vista previa de robots.txt
—

¿Partes de un archivo existente? Pega sus líneas a mano en los grupos: la vista previa reemplaza el archivo viejo al terminar.

Cómo funciona

La herramienta recorre tus grupos de reglas de arriba abajo y escribe un bloque User-agent: por grupo: primero la línea del agente, después cada Allow:, Disallow: y el Crawl-delay: opcional, y al final las líneas Sitemap: y los comentarios que hayas añadido. La vista previa se actualiza mientras escribes y copiar o descargar te da un archivo listo para la raíz de tu web en /robots.txt.

Orden de directivas y coincidencia más específica
El robot busca el grupo cuyo User-agent: coincide; si varios coinciden, Google usa el más específico (un grupo Googlebot-news gana a uno con *). Dentro de un grupo manda la ruta más larga que coincida, así que Allow: /privado/parte-publica puede abrir una excepción dentro de Disallow: /privado. El orden no da prioridad: la da la especificidad.
Disallow: / frente a Disallow: (vacío)
Disallow: / bloquea todo el sitio para ese agente. Un valor vacío, Disallow:, significa lo contrario: rastrea todo. Un grupo sin línea Disallow se comporta como el vacío, por eso el bloque inicial de esta herramienta trae una línea Disallow en blanco y no ninguna.
Comodines, anclas finales y por qué esto no es seguridad
Google y Bing amplían la sintaxis con * para cualquier carácter y $ al final, de modo que Disallow: /*.pdf$ omite todas las rutas PDF. Ten presente el límite: robots.txt es un protocolo de cortesía que los buscadores cumplen, no lo hace cumplir nadie — y el archivo es público, así que un Disallow anuncia justo lo que querías esconder. Las rutas sensibles van tras autenticación, no tras directivas.

Preguntas frecuentes

¿Una URL bloqueada desaparece de Google?

No necesariamente. Disallow impide que Google rastree la página, pero si otros sitios enlazan a esa URL Google puede seguirla listando en resultados — normalmente con el título, el aviso «URL bloqueada por robots.txt» y sin descripción. Para retirar una página de verdad necesitas que sea accesible y sirva un meta noindex (o una respuesta 410/401 con autenticación); luego robots.txt puede mantenerla fuera.

¿robots.txt es mejor que noindex para ocultar páginas?

Suele ocurrir lo contrario. Google ha dicho que bloquear por robots.txt es el método más débil de desindexación: una página bloqueada en el rastreo puede seguir en el índice, y Google no puede ver una etiqueta noindex de una página que no tiene permitido descargar. El orden fiable es: dejar rastrear, servir noindex (meta o cabecera HTTP) y añadir el Disallow solo cuando la página ya no esté en el índice.

¿Es obligatorio el Sitemap:?

No — la Search Console y los feeds pueden descubrir los sitemaps de otras formas —, pero es la autodescripción más barata que existe: una línea que dice a cada rastreador que respeta el protocolo dónde viven tus sitemaps XML. Incluye al menos la URL canónica de tu sitemap principal.

¿Puede robots.txt proteger páginas privadas o el panel de administración?

No, y confiar en eso es un error clásico. robots.txt vive en una URL pública, así que publicar un Disallow equivale a repartir la lista de tus rutas ocultas: Google y Bing indexan el propio archivo y los scraper lo leen a diario. Lo secreto va detrás de autenticación, no detrás de una directiva que los robots educados aceptan seguir.

¿Se sube algo a un servidor?

No. El archivo se ensambla con JavaScript puro a partir de lo que escribes, y copiar y descargar ocurren íntegramente en tu navegador: puedes generarlo incluso sin internet. Nada sale de tu equipo salvo que tú publiques el resultado en tu propia web.