Por qué deberías tener un archivo robots.txt personalizado si tienes contenido que no se debe indexar y qué significa cada regla

No importa si tú sitio web está construido en un CMS o simplemente en código html, css y js. Necesitarás un archivo robots.txt para evitar que los buscadores no pierdan el presupuesto asignado a tu sitio en páginas que no importan o que se indexen cosas que no deseas.

Robots-txt

También es necesario para evitar la entrada a tu sitio a aquellos navegadores que no te interesan o bots de scraping ya conocidos.

Comencemos por como deberías tener tu robots.txt

Si usas WordPress conviene que lo dejes por defecto si no vas a crear secciones personalizadas con php personalizado y que quieras que no se indexen, entonces lo puedes dejar así:


User-agent: *
Disallow: /wp-admin/
Allow: /wp-admin/admin-ajax.php

Sitemap: https://tudominio.com/wp-sitemap.xml

Para Blogger puedes dejarlo por defecto también o elegir personalizarlo para permitir ciertas etiquetas interesantes que ayuden a aclarar tu temática con Allow.

Las reglas que no cambian en el archivo robots.txt sin importar el CMS: Sitemap - Disallow o Allow.

Que significa cada regla:

  • Allow: significa que permites el acceso a ciertos lugares específicos de tu web. Aunque si lo dejas sin nada, la regla no surtirá ningún tipo de efecto.
  • Disallow: significa que no permites la entrada a la ruta que coloques.
  • Sitemap: está es la forma en la que deberías de colocar un sitemap dentro de robots.txt
Ahora ya sabrás cómo no bloquear tu sitio web sin querer.

Descubierta actualmente sin indexar: qué significa y las soluciones

Descubierta actualmente sin indexar: qué significa y las soluciones paso a paso

El problema "Descubierta actualmente sin indexar" en la herramienta search console es de los que menos contexto claro se puede llegar a tener sobre el, al igual que el problema similar "rastreada actualmente sin indexar" pero aquí te mostraré la solución.

Solución al problema Descubierta actualmente sin indexar

Cuando aparece el problema "Descubierta actualmente sin indexar" y por qué

Suele aparecer cuando creamos nuestra web, en la etapa inicial el buscador de Google y muchos otros apenas están conociendo tu web, por lo que el rastreo es lento y si encima estamos configurando el diseño, el dns, el cdn o teniendo problemas ocultos como redirecciones indeseadas, problemas con la cache o el hosting, eso haría que apareciera esa nota en el apartado de páginas.

La solución suele ser terminar de realizar todos los ajustes que tengamos pensados a nuestra web y mirar si existe algún problema que esté afectando el rastreo correcto de los artículos y como resultados final al seo de tu sitio web.

Después de verificar deberás ir a search consolé para entrar en el apartado de páginas, y presionar sobre el problema "descubierta: actualmente sin indexar", te abrirá una pestaña que contendrá un botón en la parte derecha de la pantalla que dirá «validar correción».

Después de mandar a revisión la solicitud podría llegar a tardar un par de días, toma en cuenta el tiempo, si es mucha la espera podría no estar resuelto el problema.

Recuerda que puedes usar inspeccionar url en search consolé(es la barra en grande que aparece arriba y en Mobile una lupa al lado del menú) primero para verificar si hay algún error con el artículo afectado.

¿Que es el Seo y por qué es clave?

Qué es el Seo, por qué es clave para los negocios y las habilidades necesarias para ser uno

Qué es el Seo, por qué es importante y las habilidades necesarias que se deben aprender si se desea convertir en seo

El seo ayuda a posicionar sitios webs y redes sociales en los motores de busqueda, todo gracias a un conjunto de ajustes y habilidades que se emplean para lograr obtener beneficios por aparecer como la mejor opción ante los usuarios que buscan algo en los diferentes motores de búsqueda.

Habilidades necesarias que se usan en el seo:

  • La habilidad de análisis y paciencia para obtener resultados: requerida para realizar auditorías precisas y completas.
  • Aprender sobre herramientas que te ayudarán a medir el progreso: algunas de ellas son hrefs, moz o semrush. Importantes para medir el rendimiento o encontrar oportunidades para el sitio web.
  • Compresión lectora y buena ortografía: es la habilidad que un experto en seo debe tener para crear contenido que sea comprendido por su audiencia objetivo.
  • Parte de habilidades en periodismo: para conocer como citar fuentes adecuadamente, e investigación de temas
  • Conocimientos amplios en CMS: son software que te permiten gestionar contenido, seguro los has escuchado, alguno de los más populares son WordPress, Blogger, Joomla y Drupal.

¿Por qué es importante el Seo?

Para un negocio, aplicación o sitio web estilo blog / revista, el seo suele ser la clave de su éxito. Emplean las habilidades a sus proyectos para garantizar captar el mayor tráfico posible ¿Y por qué?. Bueno, se dice que lo más difícil no es crear el sitio web(eso depende mucho de lo que se desea obtener / depende el tipo de proyecto), lo que es difícil es conseguir tráfico pero una vez lo tienen las opciones para obtener un beneficio son muchas y algunas con mucha ganancia.

Los beneficios que obtienen las empresas, negocios o personas independientes al posicionar sus sitios web

  • Productos propios: revistas, libros, aplicaciones, todo lo que te puedas imaginar
  • Anuncios: las empresas enfocadas en noticias o sitios de nicho(tema específico) se pueden beneficiar de las ganancias que dejan los negocios en sus sitios.
  • Contenido al que solo se puede acceder si es de pago: se le conoce como muro de pago, solo es posible acceder a el si te suscribes mensual o anualmente
  • Verticales: envían tráfico a webs secundarias donde tocan temas diferentes y consiguen monetizar más y crecer en audiencia de una manera más rápido al inicio
  • Servicios propios: algunos buenos ejemplos podría ser la fotografía, el seo, la psicología, entre otros, con Seo local e internacional.

El seo es identificar problemas y resolverlos (Auditoria)

Problemas que debe identificar alguien con conocimientos en seo

Saber identificar errores en diferentes niveles es algo que no se puede discutir, debes contar con mucha paciencia y la habilidad de razonar a profundidad analizando e investigando posibles problemas(Auditoria).

Problemas que se pueden encontrar en una auditoria

Podría ser un problema en el hosting, en el contenido o en el rendimiento, bueno, las razones pueden ser muchas y contar con guías útiles hará más fácil el poderlas encontrar al estar trabajando en un proyecto. No siempre se puede recordar todo, pero tener cerca una fuente confiable con la solución es algo que ahorra horas o días de trabajo.

Problemas con los que te enfrentarás si te conviertes en Seo y que debes verificar en cada auditoría si o si:

Empecemos por los básicos, que se deben revisar primero.

  • Hreflang mal implementado
  • Etiquetas canonical incorrectas
  • Páginas importantes con noindex
  • Páginas importantes bloqueadas por robots.txt
  • Meta robots mal configuradas
  • Redirecciones 301 incorrectas
  • Redirecciones 302 permanentes
  • Cadenas de redirecciones
  • Bucles de redirección
  • Errores 404
  • Errores 410 mal utilizados
  • Errores 500 del servidor
  • Contenido duplicado
  • Canibalización de palabras clave
  • Contenido de poco valor
  • Contenido generado automáticamente a gran escala
  • Relleno de palabras claves, por ejemplo en un párrafo pequeño con múltiples repetición de una palabra específica sería un texto sin mucho sentido
  • Páginas huérfanas "no enlazadas desde ningún lado de tu sitio web"
  • Profundidad de clic excesiva, es decir más de 5 subcategorías en cada subcategoría
  • Enlaces internos rotos
  • Sitemap con errores
  • Robots.txt mal configurado
  • CDN mal configurado
  • Imágenes demasiado pesadas
  • Sitio web muy lento
  • Hosting insuficiente para el volumen de tráfico entrante
  • HTTP en lugar de HTTPS
  • Certificado SSL inválido
  • Datos estructurados incorrectos
  • Meta título duplicado
  • Meta descripción duplicada
  • Múltiples H1
  • Ausencia de H1
  • Falta de intención de búsqueda
  • Contenido desactualizado
Problemas de un mal Diseño:
  • Experiencia de usuario deficiente
  • Diseño poco intuitivo, un buen diseño debe verse fácil de usar, es decir fácil de navegar en un sitio web.
  • Contraste insuficiente, el uso de colores adecuado hará que una web se vea mejor
  • Tipografía difícil de leer, la compresión rápida es el punto a tener en cuenta al elegir una tipografía adecuada
  • Diseño no adaptado a celulares y tablets, en la actualidad es indispensable que un sitio este correctamente adaptado a diferentes tamaños de pantallas, de no estarlo estarían perdiendo cientos de usuarios que prefieren buscar otras opciones ante este problema.
Problemas técnicos(importantes)

Crawl budget desperdiciado con exceso de urls sin valor: exceso de urls que no cumplen ninguna función, los CMS como WordPress suelen crear todo tipo de páginas para todo algunos ejemplos serían urls de páginas páginadas(se podrían considerar duplicados), tags en algunos casos no necesitamos que se indexen, feeds de comentarios y el más delicado "búsquedas internas" personas mal intencionadas podrían enviar múltiples búsquedas con sistemas automatizados y en poco tiempo crear miles de urls de poco valor que los buscadores podrían indexar, bajando la reputación de nuestro sitio web.

  • Exceso de urls inútiles
  • Rastreo limitado por servidor
  • Duplicadas sin canonical correcto
  • Spam generado por usuarios
  • Comentarios spam
  • Ataques de Seo negativo
  • Granja de enlaces
  • Uso de dominios expirados para manipulación SEO
  • Hackeo
  • Inyección de enlaces
  • Malware en el sitio
  • Penalización manual
  • Penalización algorítmica
  • Pérdida repentina de tráfico orgánico
  • Caída de posiciones
  • Pérdida de visibilidad en diferentes canales de exposición
  • Problemas en Google News
  • Desindexación accidental
  • Migraciones mal ejecutadas
  • Cambio de dominio sin 301
  • Cambio de estructura de urls
  • Migración https fallida
  • Cambio de CMS mal planificado
  • Internacionalización incorrecta
  • Errores de DNS
  • Problemas de página: Rastreado actualmente sin indexar y Descubierta actualmente sin indexar
  • Verificar que el sitio web no fue afectado por las actualizaciones de los motores de busqueda
Ahora comprendes mejor la labor que realiza un especialista que sabe sobre seo y que es : ayudar a mejorar la visibilidad con oportunidad oportunas, aquellas que aún no se han aplicado. Resolver problemas que podrían estar limitando el rendimiento adecuado, un trabajo que conlleva muchos meses de esfuerzo.

¿Cloudflare es la prueba de que Google no rastrea el archivo llms.txt pero el sitemap.xml si?

Conoce si Google lee tu archivo llms.txt

Cuando pasamos a tener nuestra web en cloudflare para aprovechar su cdn gratuita con los buenos beneficios que nos proporciona, también aprovechamos su panel para analizar cuáles son las páginas más visitadas por los navegadores, de esta forma podemos identificar si algo que no queremos que esté indexado se nos escapa pero... ¿Como saber si Google casi no lee el llms.txt por medio del panel de cloudflare? Bueno, la respuesta es sencilla, en el apartado de análisis de visitas cloudflare deja ver qué durante las primeras semanas de vida de una web recién creada, el buscador de Google no pasa en ningún momento por el archivo pero si por el sitemap o sitemaps que tengamos.

Es así como surgieron publicaciones en LinkedIn especulando sobre que Google no toma en cuenta ese archivo.. pero ¿Es verdad?.

¿Qué es el archivo llms.txt?

El archivo llms.txt es un archivo similar al sitemap.xml, un archivo que se actualiza constantemente con las rutas de nuestra web, solo que específicamente para la IA. "Quería aclarar que era ese archivo para los novatos antes de seguir con la explicación", ahora sigamos.

¿El buscador de Google no lee el archivo llms.txt?

Oficialmente Google en un apartado oficial de su web dedicado al archivo llms.txt si deja en claro que sus arañas rastreadoras como ellos le llaman lo leen, aunque no es impredecible eso también lo dejan claro y no supone un problema para que la IA lea tu contenido adecuadamente, o para que no te cité en los resultados enriquecidos de las respuestas de IA en caso de que no tengas ese archivo creado.

¿Lo hace o no lo hace?

Durante las primeras fases de una web que por lo general suele ser pequeña con apenas algunas urls en ellas, el buscador de Google apenas está visitando y procesando tus artículos lentamente, esperar que necesite leer un archivo para mantener su AI Overviews actualizada con tu contenido es muy apresurado por tu parte.

Apenas está leyendo las cosas técnicas, verifica que todo está en orden o si el contenido es de buena calidad. Debe pasar por todos esos procesos para decidir si eres confiable y mereces ser parte de las respuestas con IA en Google.

Aunque al final de este artículo entenderás por qué ya no lo rastrea.

Mi conclusión y por qué no lo rastrea más el buscador de Google

Desde luego esto es en base a mi experiencia, tener a cloudflare como una pared de defensa ante las inseguridades que existen en internet siempre será una buena opción y más con su capa gratuita que es generosa, es por eso que durante más de dos años he estado observando el patrón que se repite una y otra vez, al menos en el caso de Google que suele ser más lento. Bing por ejemplo a los pocos días ya puedes ver cómo su IA te cita si tu contenido es bueno y no necesariamente si tienes o no el archivo llms.txt.

Por lo que podemos deducir que este archivo no es indispensable y que de hecho el encargado del buscador en el equipo de Google ha indicado recientemente que no lo utilizan, por lo que es una elección personal incluirlo en tus proyectos.

Puede funcionar incluirlo para facilitarle las cosas a otra IA como Chatgpt, Claude o Perplexity.

Si deseas que la inteligencia artificial no rastree tu web y estás usando cloudflare puedes negarle la entrada fácilmente.

  • Paso 1: elige la opción "AI Crawl Control" de su menú
  • Paso 2: seleccionar security en el submenú que se despliega
  • Paso 3: bloquear las inteligencias artificiales que no deseas

Fuentes de las publicaciones en LinkedIn que dieron iniciativa para hablar y crear este artículo para compartir mi opinión:

Publicación 1 - Publicación 2

Conoce qué es un dominio exacto(emd) y si es bueno para el seo o no

El seo no solo depende de hacer buen contenido, también depende del "nombre de marca", este punto es clave para lograr un impacto positivo que a largo plazo solo traerá buenas cosas para nuestra web.

¿Funciona colocar el nombre exacto en el dominio?

Tener un dominio exacto con nuestro nombre o palabra de lo que tratara nuestro sitio web ayuda al reconocimiento de marca, pero no para el seo de cara a que sea un factor para que los buscadores te elijan sobre otros resultados.

Pero si te ayuda a que el público te recuerde y elija como fuente confiable fácilmente, es un tema psicológico basado en la repetición, algo que suelen hacer las grandes marcas con la publicidad, el nombre aparece en todos lados, como en la url por ejemplo.

¿Un dominio que contiene exactamente la palabra clave mejora el posicionamiento en Google?

Tener el nombre exacto en el dominio si ayuda pero no es algo que Google tome en cuenta, por lo que podemos dejar en claro que no sirve para el seo pero si indirectamente si aparte de hacer seo estás presente en redes sociales(un seguidor va a preferir tu contenido si te reconoce por el nombre exacto en la url de tu dominio). 

Recuerda que ya puedes mirar el rendimiento de tus redes sociales en Search Console.

Quiero aclarar: no por que un seguidor te prefiera quiere decir que vas a estár en las primeras posiciones de Google, para que puedas beneficiarte de eso primero debes aparecer en la primera página y eso solo se consigue "haciendo buen Seo".

Redes sociales en Search Console: Guía completa para mirar el rendimiento de tu contenido de redes sociales en Google

Google ha habilitado la función de agregar Tiktok, Instagram, Youtube y Facebook a Search Console "descubre como"

Desde siempre hemos dependido para nuestras redes sociales solo de los informes que las mismas redes sociales crean cada una, el problema era que solo nos mostraba lo que pasaba dentro de la aplicación, por ejemplo: Tiktok solo mostraba como rendía tu contenido dentro de su aplicación y nadamas. Ahora Google acaba de lanzar la implementación en Search Console para que podamos agregar Instagram, Tiktok, YouTube y X a la herramienta.

Redes sociales en Search Console Guía completa

Las redes sociales que podremos agregar

Efectivamente, como ya supones o habrás visto, solo se podrán agregar cuatro redes sociales de momento, según informa Google en el futuro se podrían sumar más.

  • Tiktok
  • Instagram
  • X
  • YouTube

El potencial que tiene para los creadores de contenido

Los creadores de contenido estaban a ciegas en cuanto a conocer el rendimiento de su contenido en Google, ahora ya es posible que puedan saberlo de manera precisa, estás son las cosas que podremos saber.

Lo que mostrara la herramienta

  • Estadísticas: un panel para informarnos rápidamente sobre si cada día o semana a semana estamos haciendo bien las cosas, este apartado te da un informe detallado sobre: clicks en el buscador, búsquedas que llevan a tu contenido(palabras claves) y los países en los que está presente tu contenido.
  • Rendimiento general: este es el típico informe, si ya tienes una web ya estás familiarizado por el y si no, es algo así: Te mostrará tablas con contenido diferente, dependiendo de en qué sección estés. Existe el informe de palabras claves que te mostrara la posición media en la que apareces para esa palabra clave, junto al ctr y volumen de búsqueda, después tenemos países y dispositivos.

Cómo agregar mi red social a Search Console

Dónde agregar las redes sociales en Search Console


  1. Paso 1: visitar la herramienta seo Search Console e iniciar sesión con una cuenta de Google.
  2. Paso 2: ir a la parte superior izquierda de la página después de iniciar sesión, donde están las tres rayitas(menú) en Mobile o en escritorio dice "Añadir propiedad".
  3. Paso 3: presionar sobre Añadir propiedad, después seleccionar el botón que dice "Nuevas funciones".
  4. Paso 4: En la ventana emergente que te saldrá seleccionas la red social que deseas agregar.
  5. Paso 5: conectar tu red social seleccionada por medio de los métodos que Google te facilita - te recomiendo que elijas el método por medio de la aplicación(solo verifica que en tu aplicación este iniciada la cuenta que quieres sumar a Search Console).
  6. Paso final: no hacer nada, Google te va a redirigir al panel oficial de su herramienta con todo vinculado correctamente.

Cómo podrás ver, el método es muy similar al de agregar un sitio web, lo único que cambia son los métodos de verificación.

Aclaraciones sobre lo que no mostrará está función nueva

Lo que no va a mostrarte está nueva función de search consolé son los clicks dentro de la aplicación de cada una de las redes sociales, eso sería contradictorio, solo se va a centrar en mostrarte el como le va a tu contenido de tus redes sociales en el buscador de Google.

Los canales que se mostraran

También podremos conocer como nuestro contenido aparece en los diferentes canales de Google: Discover, News, Búsqueda orgánica normal, Imágenes y Videos.

Que significa granja de enlaces

Este es uno de los temas más fáciles de explicar, la granja de enlaces. Comencemos entendiendo lo siguiente: los enlaces pueden funcionar para diferentes motivos.

Granja de enlaces la solución paso a paso

Dar contexto y citar fuentes oficiales de dónde estamos tomando parte de información verídica o para enviar al usuario a sitios que expliquen que es alguna palabra o termino a profundidad, y después regrese a nuestro sitio para seguir informándose sobre en lo que estaba interesado.

Y por eso es que son valiosos cuando los enlaces apuntan a nuestro sitio web, los famosos "backlinks" que le dan autoridad a la web a medida que se van adquiriendo más.

¡Importante no confundir enlaces naturales y enlaces de pago! Los enlaces naturales son aquellos cuando un editor considero que una página de tu web es de valor para sus usuarios y lo de pago son aquellos que compras.

¿Entonces como sucede la granja de enlaces?

Un sitio muy bien posicionado en el buscador de Google puede llegar a tener una confianza casi absoluta por el buscador, lo que permite que si ese sitio muy bien posicionado apunte a una web pequeña, esa web pequeña empezará con un leve ventaja a diferencia de sus competidores. Estos enlaces se suelen conseguir por medio de sitios de compraventa de enlaces donde el precio varía según la autoridad del sitio.

No hay problemas en realizar una venta de enlaces, Google indica que lo debes marcar como "sponsored" para que no lo tome a mal. Y si es legal ¿Por qué el problema?, pues resulta que algunos dueños de negocios se ciegan por las ganancias, por lo lucrativo que puede llegar a ser y es ahí donde comienzan a vender enlaces sin parar.

Provocando que más del 80% de su web tenga enlaces pagados, convirtiendo el sitio en "una granja de enlaces".

¿Qué sucede cuando Google detecta que un sitio web es una granja de enlaces?

Comienza a dexindexar todo el contenido del sitio web, con la perdida gigantesca hace que años de trabajo en el proyecto se vaya a la basura. Difícilmente los buscadores volverán a confiar en ti sitio web.

¿Se puede arreglar? Si aunque puede llevar mucho tiempo, las soluciones son:

Quitar los enlaces pagados: aunque es recomendable, existen condiciones cuando vendes enlaces, en ocasiones los compradores piden que no se retiren en años, por lo que se vuelve algo difícil de resolver si apenas has sufrido la caída de cientos o miles de páginas.

Por qué deberías tener un archivo robots.txt personalizado si tienes contenido que no se debe indexar y qué significa cada regla

No importa si tú sitio web está construido en un CMS o simplemente en código html, css y js. Necesitarás un archivo robots.txt para evitar q...

Más para explorar