ToolZen ToolZen
SEO generator client

Robots.txt Generator

Create a robots.txt file to control search engine crawler access. Set allow and disallow rules per user-agent with live preview.

Advertisement (Top Banner)
Advertisement (Bottom)

robots.txt es un archivo de texto plano en la raíz de tu dominio que indica a los rastreadores qué rutas dejar en paz. Es lo bastante simple como para escribirlo a mano y fácil de equivocar catastróficamente, sobre todo por un malentendido sobre qué hace realmente Disallow.

Disallow no significa "fuera de Google"

Este es el malentendido de mayores consecuencias del tema. Disallow le dice a un rastreador que no descargue una URL. No le dice a un buscador que no la liste. Son cosas distintas, y confundirlas produce exactamente lo contrario de lo que se pretendía.

Si otro sitio enlaza tu página bloqueada, Google puede indexar la URL sin haberla descargado jamás. El resultado ya lo has visto: un resultado de búsqueda con la dirección y la línea "No hay información disponible sobre esta página". La página está en el índice. Solo has impedido que Google lea justamente aquello que la habría descrito.

Lo que lleva a una paradoja real que conviene interiorizar. Para mantener una página fuera del índice hace falta una directiva noindex: una metaetiqueta o una cabecera HTTP en la propia página. Pero Google solo puede ver esa directiva descargando la página. Si robots.txt bloquea la descarga, el noindex nunca se lee. Disallow y noindex sobre la misma URL se anulan mutuamente, y la página sigue indexada. Elige uno: Disallow para ahorrar presupuesto de rastreo, o noindex para quitar de la búsqueda; nunca los dos.

Es un archivo público que enumera tus secretos

robots.txt lo puede descargar cualquiera en tudominio.com/robots.txt. Es de lo primero que lee alguien haciendo un test de intrusión, por la razón obvia: un archivo cuyo propósito entero es enumerar las rutas que preferirías que nadie visitara es un regalo.

Escribir Disallow: /admin-backup-2019/ no oculta ese directorio. Lo anuncia, a todo el mundo, para siempre, en un archivo diseñado para ser leído. El cumplimiento es voluntario: los rastreadores educados lo respetan y cualquier cosa maliciosa lo ignora por completo, sabiendo ahora exactamente dónde mirar.

La regla que se sigue: robots.txt es para cosas que no quieres que se rastreen, nunca para cosas que no quieres que se encuentren. Cualquier cosa genuinamente sensible necesita autenticación. Si una ruta no debe alcanzarse sin iniciar sesión, ponle un inicio de sesión: es el único mecanismo que no es una petición educada.

Bloquear rastreadores de IA es un sistema de honor

La sección de bots de IA aquí cubre los rastreadores que actualmente se declaran: GPTBot, Google-Extended, CCBot, Claude-Web, anthropic-ai y Omgilibot. Bloquearlos es una elección razonable y funciona exactamente hasta donde sus operadores decidan que funcione.

Dos cosas que conviene saber. Google-Extended no es un rastreador en absoluto: es un token que controla si el contenido ya descargado por Googlebot puede usarse para entrenar IA. Bloquearlo no afecta a tu posicionamiento en búsqueda, una distinción que Google hizo deliberadamente y que muchos propietarios de sitios se han perdido en ambas direcciones.

Y la lista envejece. Aparecen rastreadores nuevos constantemente, eligen ellos mismos sus cadenas de user-agent, y nada les obliga a anunciarse. Un robots.txt escrito hoy bloquea los bots que existían hoy. Si esto te importa, es un archivo para revisar, no para escribir una sola vez.

Las reglas con las que se tropieza

El archivo debe estar en la raíz, exactamente en /robots.txt. Un archivo en /subcarpeta/robots.txt se ignora por completo, y los subdominios necesitan el suyo: un robots.txt en ejemplo.com no dice nada sobre tienda.ejemplo.com.

Las rutas distinguen mayúsculas: Disallow: /Admin no bloquea /admin. La coincidencia es por prefijo, así que Disallow: /pagina bloquea /pagina, /paginas y /pagina-dos por igual; la barra final importa más de lo que parece.

Cuando una URL coincide con varias reglas, gana la más específica y no la primera, y por eso Allow puede recortar una excepción dentro de un Disallow más amplio. Y un Disallow: vacío significa permitir todo, mientras que Disallow: / bloquea el sitio entero. Un carácter entre ambas, y es el carácter con más probabilidades de quedarse tras un despliegue de staging.

Preguntas frecuentes

¿Se envía algo a un servidor?

No. Esta herramienta está marcada como "client": el archivo se monta en la pestaña de tu navegador con lo que escribes. No se transmite nada.

Bloqueé una página y sigue en Google. ¿Por qué?

Porque bloquear el rastreo no elimina el resultado: mira arriba. Si la página ya está indexada, la solución es quitar el Disallow para que Google pueda volver a descargarla, servirle un noindex, esperar a un nuevo rastreo, y solo entonces bloquearla si todavía quieres. Contraintuitivo, y es la única secuencia que funciona.

¿Necesito siquiera un robots.txt?

No para un sitio pequeño sin nada que ocultar: ningún archivo significa rastréalo todo, que suele ser lo que quieres. Se gana su sitio cuando tienes rutas que merece dejar fuera del rastreo: páginas de resultados de búsqueda que generan URLs infinitas, filtros por facetas, zonas de staging. Un robots.txt ausente devuelve un 404 y los rastreadores lo manejan perfectamente, así que un archivo vacío no es algo que añadir por añadir.

¿Debo listar mi sitemap ahí?

Sí, cuesta una línea y todos los buscadores importantes la leen. No sustituye a enviar el sitemap en Search Console —ahí es donde ves si las URLs se indexaron de verdad— pero es como la encuentran los rastreadores que no son Google.

¿Funciona Crawl-delay?

Con Google no, que lo ignora por completo; la frecuencia de rastreo se controla en Search Console. Bing y Yandex sí lo respetan. Si Googlebot está sobrecargando de verdad tu servidor, eso es señal de que algo va mal en el servidor más que en el rastreador, pero el ajuste existe en Search Console si lo necesitas.