Robots.txt: qué es, por qué es importante y cómo usarlo
Los motores de búsqueda utilizan robots, conocidos como rastreadores web/arañas, para explorar internet e indexar los contenidos disponibles.
Los motores de búsqueda utilizan robots, conocidos como rastreadores web/arañas, para explorar todo internet e indexar la mayoría, si no todos, los contenidos disponibles. En respuesta a esto, se estableció un estándar llamado "Protocolo de Exclusión de Robots", que permite incluir un archivo llamado robots.txt en la raíz del sitio para indicar a los robots de búsqueda qué páginas no deben visitar.
La importancia del Robots.txt para tu sitio
El archivo robots.txt es una herramienta crucial para cualquier proyecto web, ya que permite que los motores de búsqueda sepan a qué archivos o directorios pueden acceder. Es importante crear un archivo robots.txt, aunque esté vacío, en la raíz del dominio para garantizar que los motores de búsqueda puedan acceder a todo el sitio si ocurre algo inusual con el servidor y Google opta por no leer el sitio completo.
Es fundamental recordar que solo debe haber un archivo robots.txt por sitio y que este debe estar en el directorio raíz. Si hay otro archivo robots.txt en cualquier otro directorio, los motores de búsqueda no accederán a él. Sin embargo, en las grandes empresas, esta práctica puede no ser conveniente, ya que no todos los empleados tienen acceso al directorio raíz del sitio.
El objetivo de los robots de los buscadores es navegar por internet e indexar contenido para mostrarlo en los resultados de búsqueda. Sin embargo, en algunos casos se desea que ciertas páginas no aparezcan, como las que se muestran a continuación.
Páginas de inicio de sesión
Por lo general, las páginas que permiten acceder a áreas restringidas, como una intranet, no deben indexarse;
Páginas con contenido duplicado
Si tienes varias landing pages con contenido similar para tus campañas de Google AdWords, es recomendable bloquear las copias e indexar solo una versión para evitar problemas de contenido duplicado;
Páginas de impresión
Si tu sitio tiene versiones para pantalla e impresión, es recomendable eliminar la versión de impresión del índice de Google.
Por último, es importante destacar que el archivo robots.txt no es una medida de seguridad, ya que impide que los robots de búsqueda lean el contenido especificado, pero no impide el acceso de los usuarios.
Cómo crear un archivo robots.txt
Hay varias formas de crear un archivo robots.txt, por ejemplo, con el Bloc de notas o cualquier otro editor de texto sencillo. Sin embargo, existen herramientas gratuitas en línea que permiten seleccionar las páginas que se deben bloquear para los robots de búsqueda. La herramienta proporciona el código completo, listo para usar en tu archivo robots.txt. Recomendamos probar una de estas herramientas para facilitar la creación del archivo.
Aquí puedes ver un generador de Robots.txt.
Formato y sintaxis del archivo robots.txt
La sintaxis del archivo robots.txt se utiliza para crear una política de acceso para los robots. Incluye palabras reservadas que funcionan como comandos para permitir o denegar el acceso a determinados directorios o páginas de un sitio. A continuación se indican los principales comandos del archivo robots.txt.
User-agent
El comando User-agent sirve para indicar qué robots deben seguir las reglas definidas en el archivo robots.txt. Por ejemplo, si quieres que solo el motor de búsqueda de Google siga las instrucciones del archivo, debes indicar Googlebot como User-agent. Estas son las principales opciones:
• Google: User-agent: Googlebot
• Google Imágenes: User-agent: Googlebot-images
• Google Adwords: User-agent: Adsbot-Google
• Google Adsense: User-agent: Mediapartners-Google
• Yahoo: User-agent: Slurp
• Bing: User-agent: Bingbot
Todos los motores: User-agent: * (o simplemente no incluir el comando User-agent)
Sitemap
El comando Sitemap permite indicar la ruta y el nombre del sitemap del sitio en formato XML. Sin embargo, la herramienta para webmasters de Google ofrece un mayor control y visibilidad sobre esta función. Así es como Google incluye varios sitemaps en su archivo robots.txt:
• Sitemap: http://www.google.com/hostednews/sitemap_index.xml
• Sitemap: http://www.google.com/sitemaps_webmasters.xml
• Sitemap: http://www.google.com/ventures/sitemap_ventures.xml
• Sitemap: http://www.gstatic.com/dictionary/static/sitemaps/sitemap_index.xml
• Sitemap: http://www.gstatic.com/earth/gallery/sitemaps/sitemap.xml
• Sitemap: http://www.gstatic.com/s2/sitemaps/profiles-sitemap.xml
• Sitemap: http://www.gstatic.com/trends/websites/sitemaps/sitemapindex.xml
Disallow
El comando Disallow indica a los motores de búsqueda qué directorios o páginas no deben incluirse en el índice. Estos son algunos ejemplos:
• Disallow: /prod - indica a los robots que no indexen carpetas ni archivos que empiecen por "prod";
• Disallow: /prod/ - indica a los robots que no indexen el contenido de la carpeta "prod";
• Disallow: print1.html - indica a los robots que no indexen el contenido de la página print1.html.
Allow
El comando Allow indica a los robots qué directorio o página debe indexarse. Los directorios y las páginas se permiten de forma predeterminada, por lo que este comando solo debe usarse cuando el webmaster haya bloqueado el acceso a un directorio mediante el comando Disallow, pero quiera que se indexe un archivo o subdirectorio dentro del directorio bloqueado. Mira el ejemplo a continuación:
• Disallow: /catalogs
• Allow: /catalogs/about
Allow permite indexar el directorio /about dentro del directorio /catalogs.
Conclusiones finales para aprovechar al máximo tu robots.txt
Entiende la sintaxis
Antes de crear tu archivo robots.txt, es fundamental que entiendas su sintaxis para evitar errores y crear reglas correctas.
Usa las palabras clave adecuadas
Para indicar qué robots deben seguir las reglas, qué páginas deben bloquearse y cuáles deben permitirse, utiliza las palabras clave adecuadas, como "User-agent", "Disallow" y "Allow".
No confíes plenamente en robots.txt
Ten en cuenta que el archivo robots.txt es solo una sugerencia para los robots de búsqueda, y algunos pueden ignorar las reglas o interpretarlas de otra manera.
Utiliza herramientas de prueba
Antes de implementar el archivo robots.txt en tu sitio, utiliza herramientas de prueba para comprobar que las reglas funcionen correctamente y que las páginas que quieres bloquear estén realmente bloqueadas.
Actualízalo con regularidad
Es importante mantener actualizado el archivo robots.txt, sobre todo cuando hagas cambios en el sitio que puedan afectar la indexación. Si eliminas una página o un directorio de tu sitio, recuerda quitar la regla Disallow correspondiente del archivo robots.txt.
Ten cuidado al usar Disallow
Usa el comando Disallow con precaución, ya que puede bloquear páginas importantes de tu sitio, como las de productos o categorías. Asegúrate de que las páginas que bloqueas no sean fundamentales para la indexación ni para la experiencia del usuario.
Incluye un sitemap
Añade un sitemap XML a tu sitio para ayudar a los robots de búsqueda a encontrar todas las páginas importantes. Así puedes contribuir a que todas se indexen correctamente.