robots.txt es uno de los archivos más antiguos y con más impacto real del SEO técnico: un simple archivo de texto en la raíz de tu dominio que le dice a los rastreadores qué pueden y qué no pueden indexar. Y desde que los modelos de IA generativa entrenan con contenido web a gran escala, se ha convertido también en la primera línea de defensa para decidir si tu contenido se usa para entrenar esos modelos.
Qué es y dónde vive
El archivo robots.txt se coloca siempre en la raíz del dominio (tudominio.com/robots.txt) y contiene reglas que los rastreadores (de buscadores, de IA, o de cualquier otro tipo) deberían respetar de forma voluntaria. No es un mecanismo de seguridad: es una convención que los bots bien portados cumplen, pero no impide técnicamente que uno mal intencionado ignore las reglas.
La estructura básica
Cada regla se dirige a un User-agent (el nombre del bot) y define rutas permitidas (Allow) o bloqueadas (Disallow):
User-agent: *
Disallow: /admin/
Disallow: /api/
Sitemap: https://tudominio.com/sitemap.xml
User-agent: * aplica la regla a todos los bots; se puede dirigir a un bot concreto usando su nombre exacto (User-agent: Googlebot).
Por qué incluir el sitemap importa
Añadir la línea Sitemap: al final del robots.txt es, para muchos rastreadores, la primera forma en que descubren dónde está el mapa completo de URLs de tu sitio. Es una línea que cuesta nada añadir y que facilita activamente el rastreo de las páginas que sí quieres indexadas.
Bloquear crawlers de entrenamiento de IA
Además de los rastreadores de buscadores tradicionales, existen bots específicos que las empresas de IA usan para recopilar contenido con el que entrenar sus modelos: GPTBot (OpenAI), ClaudeBot (Anthropic), Google-Extended, entre otros. Estos bots respetan robots.txt como cualquier otro rastreador serio, así que bloquearlos específicamente es tan simple como añadir una regla dedicada:
User-agent: GPTBot
Disallow: /
User-agent: ClaudeBot
Disallow: /
Esto es independiente del bloqueo a buscadores tradicionales: puedes seguir permitiendo que Google y Bing indexen tu contenido para aparecer en resultados de búsqueda, mientras bloqueas específicamente a los bots de entrenamiento de IA.
Cómo generar tu robots.txt
- Elige qué bots quieres permitir o bloquear, incluyendo los crawlers de IA específicos si quieres excluirlos.
- Define las rutas que no deben rastrearse (paneles de administración, APIs internas, contenido duplicado).
- Añade la URL de tu sitemap.
- Descarga o copia el archivo generado y súbelo a la raíz de tu dominio.
Puedes hacerlo gratis con el generador de robots.txt de esta web.
Por qué no es una medida de seguridad
Es importante no confundir robots.txt con protección de acceso real. Bloquear una ruta en robots.txt no impide que alguien acceda directamente a esa URL escribiéndola en el navegador, ni evita que un bot mal intencionado la rastree ignorando las reglas. Para contenido que realmente necesita estar protegido, hace falta autenticación real, no una entrada en este archivo.
Preguntas frecuentes
¿Bloquear GPTBot afecta a mi posicionamiento en Google? No, son bots completamente independientes; bloquear crawlers de IA no afecta al rastreo de Googlebot ni al SEO tradicional.
¿Es obligatorio tener un robots.txt? No, pero su ausencia significa que, por defecto, todo el contenido es rastreable sin ninguna restricción explícita.
¿Puedo bloquear una carpeta pero permitir un archivo concreto dentro de ella? Sí, usando reglas Allow más específicas junto al Disallow general de la carpeta.
¿Bloquear un bot en robots.txt lo bloquea técnicamente? No, solo le pide que no rastree; un bot que decide ignorar la convención puede seguir accediendo, por lo que no sustituye a medidas de bloqueo reales a nivel de servidor si eso es lo que necesitas.
Genera tu robots.txt gratis con el generador de robots.txt, con reglas por bot, sitemap y bloqueo de crawlers de IA en segundos.