Por qué deberías tener un archivo robots.txt personalizado si tienes contenido que no se debe indexar y qué significa cada regla

No importa si tú sitio web está construido en un CMS o simplemente en código html, css y js. Necesitarás un archivo robots.txt para evitar que los buscadores no pierdan el presupuesto asignado a tu sitio en páginas que no importan o que se indexen cosas que no deseas.

Robots-txt

También es necesario para evitar la entrada a tu sitio a aquellos navegadores que no te interesan o bots de scraping ya conocidos.

Comencemos por como deberías tener tu robots.txt

Si usas WordPress conviene que lo dejes por defecto si no vas a crear secciones personalizadas con php personalizado y que quieras que no se indexen, entonces lo puedes dejar así:


User-agent: *
Disallow: /wp-admin/
Allow: /wp-admin/admin-ajax.php

Sitemap: https://tudominio.com/wp-sitemap.xml

Para Blogger puedes dejarlo por defecto también o elegir personalizarlo para permitir ciertas etiquetas interesantes que ayuden a aclarar tu temática con Allow.

Las reglas que no cambian en el archivo robots.txt sin importar el CMS: Sitemap - Disallow o Allow.

Que significa cada regla:

  • Allow: significa que permites el acceso a ciertos lugares específicos de tu web. Aunque si lo dejas sin nada, la regla no surtirá ningún tipo de efecto.
  • Disallow: significa que no permites la entrada a la ruta que coloques.
  • Sitemap: está es la forma en la que deberías de colocar un sitemap dentro de robots.txt
Ahora ya sabrás cómo no bloquear tu sitio web sin querer.

Por qué deberías tener un archivo robots.txt personalizado si tienes contenido que no se debe indexar y qué significa cada regla

No importa si tú sitio web está construido en un CMS o simplemente en código html, css y js. Necesitarás un archivo robots.txt para evitar q...

Más para explorar