Saltar al contenido
Revisa tu sitio

Guías

«Bloqueada por robots.txt»: qué significa y cómo arreglarlo

El robots.txt es un archivo de texto con instrucciones para los rastreadores. Es de las pocas cosas que, con una sola línea mal puesta, pueden sacar un sitio completo de Google mientras todo lo demás sigue funcionando.

Qué es el robots.txt

Es un archivo que vive en tudominio.cl/robots.txt y le indica a los rastreadores a qué direcciones de tu sitio pueden entrar. Según Google, su función principal es administrar el tráfico de los rastreadores para que no sobrecarguen el servidor.

Un robots.txt típico de un sitio chico se ve así:

  • User-agent: * — la regla aplica a todos los rastreadores.
  • Disallow: /wp-admin/ — no entrar al panel de administración.
  • Sitemap: https://tudominio.cl/sitemap.xml — dónde está la lista de páginas.

La línea que saca un sitio entero

Disallow: / debajo de User-agent: * significa «no entres a ninguna parte». Es la regla que se pone mientras un sitio está en construcción, y a veces se queda ahí después del lanzamiento.

El sitio funciona perfecto para las personas, así que nadie lo nota. Lo único que se ve es que Google no muestra nada, o muestra las páginas sin descripción.

Qué significan los avisos de Search Console

En el informe de indexación de páginas aparecen dos avisos distintos, y se resuelven al revés:

  • «El archivo robots.txt ha bloqueado la URL». Google no entró a la página porque el robots.txt se lo impide. Si esa página debería aparecer en Google, hay que quitar la regla que la bloquea.
  • La página se indexó aunque el robots.txt la bloquea. Google no entró, pero encontró enlaces hacia ella y la incluyó igual, normalmente sin descripción. Si quieres que aparezca, quita el bloqueo. Si quieres que no aparezca, también quita el bloqueo, y usa la etiqueta noindex.

El error de fondo: robots.txt no esconde páginas

Google lo dice sin rodeos: el robots.txt no es un mecanismo para impedir que una página aparezca en Google. Solo impide que el rastreador entre. Si otras páginas enlazan a esa dirección, puede terminar en los resultados igual.

Para que una página no aparezca se usa la etiqueta noindex. Y aquí está la trampa: para que Google lea el noindex tiene que poder entrar a la página. Si la bloqueas en el robots.txt, nunca ve la etiqueta. Bloquear y poner noindex a la vez es justo la combinación que no funciona.

Cómo revisarlo

Abre tudominio.cl/robots.txt en el navegador y busca una línea Disallow: / sola. Si no existe el archivo, no es grave: sin robots.txt, los rastreadores entienden que pueden entrar a todo.

En Search Console, el informe de robots.txt está en la configuración de la propiedad y muestra qué archivo encontró Google, cuándo lo leyó y si tiene errores.

Dónde se edita en cada plataforma

  • WordPress: si usas Yoast SEO, desde Yoast SEO → Herramientas → Editor de archivos. Si el robots.txt bloquea todo, revisa además en Ajustes → Lectura la opción que pide a los buscadores no indexar el sitio.
  • Wix: en SEO y GEO → Herramientas y ajustes → Editor de robots.txt. Wix advierte que es una función avanzada y que su atención al cliente no ayuda con cambios en ese archivo.
  • Shopify: se personaliza con la plantilla robots.txt.liquid, desde Tienda online → Temas → Editar código. Shopify advierte que un mal uso puede costar todo el tráfico y que su soporte no ayuda con esa plantilla.

¿Y los rastreadores de inteligencia artificial?

El robots.txt también sirve para permitir o bloquear a los rastreadores de IA, que se identifican con nombre propio, como GPTBot o ClaudeBot. Si quieres que un asistente pueda citar tu sitio, no pueden estar bloqueados. Lo explicamos en cómo hacer que ChatGPT cite tu sitio.

El análisis gratuito revisa si tu sitio tiene robots.txt, si bloquea el sitio completo y si declara el sitemap, y te dice qué línea cambiar.

Preguntas frecuentes

¿Qué significa «bloqueada por robots.txt»?

Que el archivo robots.txt de tu sitio le impide a Google entrar a esa página. Si la página debería aparecer en Google, hay que quitar la regla que la bloquea.

¿Para qué sirve el archivo robots.txt?

Para indicarle a los rastreadores a qué direcciones de tu sitio pueden entrar. Google lo describe como una forma de administrar el tráfico de los rastreadores, no de ocultar páginas.

¿Robots.txt o noindex: cuál uso para que una página no aparezca en Google?

Noindex. El robots.txt no impide que una página aparezca si hay enlaces hacia ella. Y para que Google lea el noindex, la página no puede estar bloqueada en el robots.txt.

¿Es obligatorio tener un archivo robots.txt?

No. Sin robots.txt, los rastreadores entienden que pueden entrar a todo el sitio. Conviene tenerlo para bloquear zonas como el panel de administración y para declarar el sitemap.

¿Puedo bloquear a los rastreadores de inteligencia artificial?

Sí. Los rastreadores de IA se identifican con nombre propio, como GPTBot, y se pueden permitir o bloquear uno por uno en el robots.txt. Conviene revisar cuál es cuál: algunas empresas usan un rastreador para entrenar sus modelos y otro distinto para buscar y citar fuentes.

Sin registro y sin instalar nada. Ves todos los problemas gratis; el informe con las soluciones cuesta $19.990.

Seguir leyendo

Según tu plataforma