Validar robots.txt
Comprueba la sintaxis de tu robots.txt y prueba si una ruta está permitida o bloqueada para Googlebot, Bingbot, GPTBot o el agente que tú indiques.
Sobre el robots.txt
El archivo robots.txt le dice a los rastreadores qué páginas o secciones de tu sitio pueden recorrer y cuáles no. Vive en la raíz de tu dominio: https://ejemplo.com/robots.txt.
User-agent: *se aplica a todos los rastreadores. Escribe el nombre de uno concreto para dirigirte solo a él.Disallow: /rutabloquea esa ruta.Allow: /rutala permite de forma explícita.- Las reglas más concretas (las de ruta más larga) mandan sobre las más cortas.
- El robots.txt solo sugiere: los rastreadores que se portan bien lo respetan, los bots malintencionados puede que no.
- Añade siempre una directiva
Sitemap:que apunte a tu sitemap XML.
Preguntas frecuentes
¿«Disallow: /» bloquea mi sitio entero?
Sí. Disallow: / les dice a los rastreadores que se salten todas las páginas. Se usa a veces en entornos de pruebas, pero nunca debe llegar a producción.
¿Puedo permitir Googlebot y bloquear a los demás?
Sí. Pon un bloque específico de User-agent: Googlebot con Allow: /, y un bloque comodín con Disallow: / para el resto.
¿El robots.txt impide que una página salga en Google?
No. Bloquear el rastreo impide que Google lea el contenido, pero la URL puede seguir apareciendo en los resultados si otros sitios la enlazan. Para que no se indexe, usa una etiqueta noindex en su lugar.
¿Qué es GPTBot?
Es el rastreador web de OpenAI, que se usa para entrenar modelos de IA. Puedes bloquearlo con User-agent: GPTBot seguido de Disallow: /.