¿QUÉ ES ROBOTS.TXT? EL MANUAL DE INSTRUCCIONES PARA LOS BOTS EN TU SITIO WEB

El fichero robots.txt es un archivo de texto plano creado por los administradores de un sitio web para indicar a los motores de búsqueda, como Google, Bing o Yahoo, qué páginas o carpetas tienen permitido rastrear y cuáles deben ignorar.
Es una herramienta fundamental de la infraestructura web que cumple funciones específicas:
  • Controlar el rastreo: Administra la actividad de los bots dentro de un servidor web.
  • Evitar indexaciones no deseadas: Impide que secciones específicas aparezcan en los resultados de búsqueda globales.
  • Proteger áreas sensibles: Oculta directorios internos que no tienen valor público.
  • Optimizar el tiempo de los bots: Ayuda a aprovechar de forma eficiente el presupuesto de rastreo, enfocando a los buscadores en el contenido valioso.

¿Cómo funciona el proceso de lectura?

Cuando un motor de búsqueda decide visitar un sitio web, no entra directamente a los artículos o productos; lo primero que hace es buscar este archivo en la raíz del servidor.
  1. Búsqueda inicial: El rastreador accede a la dirección raíz, ej. "//sitioweb.com".
  2. Lectura de reglas: Examina las directivas escritas en el fichero robots.txt.
  3. Filtrado de contenido: El bot identifica con claridad qué secciones tiene permitido analizar.
  4. Ejecución eficiente: El robot procede a escanear la web saltándose por completo las rutas restringidas, haciendo el proceso mucho más ágil.

¿Cómo se estructura un archivo robots.txt?

El archivo robots.txt utiliza una sintaxis muy sencilla basada en directivas clave interpretadas por cualquier rastreador moderno. Un ejemplo estándar se compone de la siguiente forma:

User-agent: *
Disallow: /admin/
Disallow: /private/
Allow: /
Sitemap: https://sitioweb.com
  • User-agent: *: Define a qué motores de búsqueda se aplican las reglas. El asterisco (*) significa que la norma es universal para todos los bots del mundo.
  • Disallow: "/carpeta/": Bloquea el acceso por completo a la carpeta de administración. Los bots no entrarán en esa página.
  • Disallow: "/carpeta/": Restringe el acceso a directorios con información privada o archivos de sistema.
  • Allow: "/": Permite explícitamente el acceso y rastreo al resto de las páginas del sitio web.
  • Sitemap:: Indica de forma opcional pero recomendada la ubicación exacta del mapa del sitio para facilitar el trabajo del buscador.

¿Dónde se utiliza y cuáles son sus beneficios?

Su uso es universal y obligatorio para cualquier plataforma profesional indexada en internet, incluyendo blogs, tiendas en línea, portales corporativos y aplicaciones web de contenido público.

Beneficios clave

  • Mejora el SEO técnico: Evita que el contenido duplicado o de prueba afecte el posicionamiento.
  • Seguridad por oscuridad: Mantiene las URL de gestión interna fuera del alcance de los buscadores de internet.
  • Ahorro de recursos: Reduce el consumo de ancho de banda y la carga del servidor causada por visitas masivas de bots irrelevantes.