El archivo robots.txt parece una cosa pequeña.
Un archivo de texto, unas cuantas líneas, un par de instrucciones y listo.
Pero cuando está mal configurado puede dar más guerra de la que parece: páginas que Google no rastrea, avisos en Search Console, zonas de la web bloqueadas sin querer, sitemaps que no se declaran o reglas copiadas de otro sitio que nadie revisó antes de pegar.
robots.txt no es magia SEO, pero sí puede afectar a cómo los rastreadores acceden a tu web. Y en WordPress, donde muchas veces se mezclan plugins SEO, temas, constructores visuales, caché y sitemaps automáticos, conviene saber qué estás tocando antes de editarlo.
Respuesta rápida: el archivo robots.txt sirve para dar instrucciones de rastreo a bots como Googlebot o Bingbot. Puede indicar qué zonas de una web no deberían rastrear y dónde está el sitemap XML. Pero no sirve para proteger contenido privado, no garantiza que una URL desaparezca de Google y no sustituye a una etiqueta noindex.
En esta guía vamos a verlo con calma, especialmente aplicado a WordPress.
Lo importante: robots.txt puede ayudarte a ordenar el rastreo, pero también puede bloquear partes importantes de tu web si lo copias sin entenderlo. No es un archivo para hacer experimentos alegres en una web que ya está publicada.
Qué es el archivo robots.txt
El archivo robots.txt es un archivo de texto que se coloca normalmente en la raíz de un dominio.
Se puede consultar escribiendo en el navegador algo como:
https://tudominio.com/robots.txt
Su función es dar instrucciones a los rastreadores automatizados sobre qué partes del sitio pueden o no pueden rastrear.
Por ejemplo, puede indicar a Googlebot que no rastree determinadas carpetas internas, parámetros, resultados de búsqueda o zonas que no aportan valor para aparecer en Google.
Un ejemplo muy básico sería:
User-agent: *
Disallow: /wp-admin/
Allow: /wp-admin/admin-ajax.php
Sitemap: https://tudominio.com/sitemap_index.xml
Traducido a lenguaje normal:
User-agent: *se dirige a todos los rastreadores.Disallow: /wp-admin/indica que no deberían rastrear esa carpeta.Allow: /wp-admin/admin-ajax.phppermite una excepción concreta.Sitemapseñala dónde está el mapa del sitio XML.
No todos los robots obedecen de la misma forma. Los rastreadores serios suelen respetarlo, pero un bot malicioso puede ignorarlo tranquilamente.
robots.txt es una instrucción para rastreadores, no una puerta cerrada con llave.
Para qué sirve realmente robots.txt
El archivo robots.txt puede ser útil para gestionar el rastreo de una web.
Su uso tiene sentido cuando quieres indicar a los bots qué partes no deberían rastrear o cuando quieres declarar la ubicación del sitemap.
Puede servir para:
- Evitar el rastreo de zonas internas sin valor SEO.
- Reducir el acceso de bots a determinadas rutas.
- Indicar la URL del sitemap XML.
- Gestionar rastreadores concretos mediante
User-agent. - Evitar que se rastreen resultados internos de búsqueda o parámetros innecesarios.
- Ordenar mejor el acceso de bots en webs grandes.
En una web WordPress normal, no siempre hace falta complicarlo.
De hecho, muchas veces un robots.txt sencillo y bien revisado es mejor que un archivo lleno de reglas heredadas, copiadas de foros o pegadas desde una plantilla antigua.
Para qué no sirve robots.txt
Esta parte es clave.
robots.txt no sirve para todo.
Y usarlo para cosas que no debe hacer puede provocar problemas.
No sirve para proteger contenido privado
El archivo robots.txt es público.
Cualquiera puede verlo añadiendo /robots.txt al dominio.
Por eso no deberías usarlo para “ocultar” rutas sensibles.
Si tienes una carpeta privada, un área de clientes, documentos internos o contenido confidencial, no lo protejas con robots.txt.
Usa contraseñas, permisos, autenticación, restricciones de servidor o soluciones de seguridad reales.
robots.txt no es una cerradura. Si pones una ruta privada en este archivo, no la estás protegiendo: la estás señalando en un archivo público.
No sirve para eliminar una URL de Google
Bloquear una URL en robots.txt impide o limita el rastreo, pero no siempre impide que esa URL aparezca en los resultados si Google la descubre por enlaces.
Este matiz es muy importante.
Si quieres que una página no se indexe, normalmente debes usar noindex mediante meta robots o cabecera HTTP, dejando que Google pueda rastrear esa URL para leer la instrucción.
Si bloqueas la URL por robots.txt, Google puede no llegar a ver el noindex.
Es como poner una nota dentro de una habitación y luego cerrar la puerta antes de que la lean.
No sirve para bloquear bots maliciosos
Un bot malicioso puede ignorar robots.txt.
Para limitar ataques, spam, scraping agresivo o accesos sospechosos, hacen falta otras medidas: firewall, reglas de servidor, seguridad WordPress, protección de formularios, limitación de peticiones y revisión de logs.
No sirve para meter cualquier directiva SEO
No todo lo que se escribe en robots.txt tiene efecto.
Por ejemplo, noindex dentro de robots.txt no es una directiva válida para Google.
Tampoco conviene confiar en crawl-delay pensando que Google lo va a obedecer, porque Google no lo soporta como directiva de robots.txt.
Dónde está el robots.txt de una web
Para ver el robots.txt de una web, normalmente basta con visitar:
https://tudominio.com/robots.txt
Si existe un archivo físico, el servidor lo mostrará.
En WordPress puede haber dos situaciones:
- Un archivo
robots.txtfísico en la raíz del sitio. - Un robots.txt virtual generado por WordPress o por un plugin SEO.
Esto puede confundir un poco.
A veces entras por FTP y no ves ningún archivo robots.txt, pero al visitar /robots.txt sí aparece contenido.
Eso suele pasar porque WordPress o un plugin está generando una versión virtual.
Robots.txt en WordPress
WordPress puede generar un robots.txt básico si no existe un archivo físico.
Además, plugins SEO como Yoast SEO o Rank Math pueden permitir editarlo desde el panel, aunque el comportamiento puede depender de si existe ya un archivo físico, de permisos de escritura y de la configuración del servidor.
En Yoast SEO, por ejemplo, puede editarse desde sus herramientas de edición de archivos cuando la instalación lo permite.
Aun así, no conviene tocar robots.txt solo porque “está ahí”.
Antes de editarlo, revisa:
- Si hay un archivo físico en la raíz del servidor.
- Si un plugin SEO está generando un robots.txt virtual.
- Si la web tiene sitemap XML.
- Si Search Console muestra avisos relacionados con robots.txt.
- Si hay reglas antiguas heredadas de otra web.
- Si hay bloqueos que afectan a páginas importantes.
Consejo ideaWeb: si una web WordPress no tiene problemas de rastreo, no hace falta llenar robots.txt de reglas “por si acaso”. En SEO técnico, muchas veces tocar menos pero tocar bien es mejor que añadir instrucciones que nadie ha probado.
Ejemplo básico de robots.txt para WordPress
Un robots.txt sencillo para muchas webs WordPress podría ser algo parecido a esto:
User-agent: *
Disallow: /wp-admin/
Allow: /wp-admin/admin-ajax.php
Sitemap: https://tudominio.com/sitemap_index.xml
Este ejemplo bloquea el rastreo de /wp-admin/, permite admin-ajax.php y declara el sitemap.
Pero no copies este ejemplo sin revisar tu caso.
La URL del sitemap puede variar según el plugin SEO o configuración:
- Yoast SEO suele usar una ruta tipo
/sitemap_index.xml. - Rank Math también puede usar
/sitemap_index.xml. - WordPress puede generar sitemaps nativos con otra estructura.
- Algunas webs tienen sitemaps personalizados.
Lo importante es que la URL declarada exista y cargue correctamente.
Qué significan User-agent, Disallow, Allow y Sitemap
Las directivas básicas de robots.txt no son complicadas, pero conviene entenderlas.
| Directiva | Qué significa | Ejemplo |
|---|---|---|
User-agent |
Indica a qué rastreador va dirigida la regla. | User-agent: Googlebot |
Disallow |
Indica una ruta que no debería rastrearse. | Disallow: /privado/ |
Allow |
Permite una ruta concreta, útil como excepción. | Allow: /wp-admin/admin-ajax.php |
Sitemap |
Indica la ubicación del sitemap XML. | Sitemap: https://tudominio.com/sitemap_index.xml |
También puedes dirigir reglas a bots concretos.
Por ejemplo:
User-agent: Googlebot
Disallow: /ejemplo/
User-agent: Bingbot
Disallow: /otra-ruta/
Pero en una web normal no suele hacer falta complicarse tanto.
Cuantas más reglas añades, más fácil es equivocarse.
Robots.txt, noindex y sitemap: no son lo mismo
Estos tres conceptos se mezclan mucho.
Y no deberían.
| Elemento | Para qué sirve | Error típico |
|---|---|---|
| robots.txt | Controlar rastreo de bots. | Usarlo para intentar desindexar páginas. |
| noindex | Indicar que una URL no debe aparecer en el índice. | Bloquear la URL por robots.txt y evitar que Google vea el noindex. |
| sitemap XML | Ayudar a descubrir URLs importantes. | Pensar que incluir una URL en sitemap garantiza que posicione. |
Si quieres que Google no rastree una zona, robots.txt puede tener sentido.
Si quieres que una página no se indexe, piensa en noindex.
Si quieres ayudar a descubrir páginas importantes, revisa el sitemap.
Cada herramienta tiene su función.
Usarlas mal es como intentar apretar un tornillo con una cuchara: puede que algo muevas, pero no es el camino.
Errores frecuentes con robots.txt
Estos son algunos errores que vemos con frecuencia en auditorías y revisiones de WordPress.
Bloquear toda la web sin querer
Este es el clásico susto.
User-agent: *
Disallow: /
Esta regla indica a los bots que no rastreen nada del sitio.
Puede usarse temporalmente en entornos de prueba, pero en una web publicada puede provocar un problema serio de rastreo.
Si tu web no aparece bien en Google después de una migración o rediseño, merece la pena revisar esto.
Dejar reglas de una web en desarrollo
Durante el desarrollo, algunas webs se bloquean para evitar que Google rastree una versión provisional.
El problema llega cuando se publica la web final y nadie quita el bloqueo.
Resultado: web nueva, diseño bonito, ilusión máxima… y Google con la puerta cerrada.
Bloquear carpetas importantes
Algunas reglas antiguas bloqueaban carpetas de recursos, plugins, temas o archivos necesarios para que Google renderice bien la página.
Si bloqueas recursos importantes, Google puede tener más difícil entender cómo se ve y funciona la web.
Usar robots.txt para ocultar contenido privado
Ya lo hemos visto, pero merece repetirse.
No uses robots.txt para proteger documentos, carpetas privadas o zonas sensibles.
Es un archivo público.
Confundir Disallow con noindex
Disallow bloquea rastreo.
noindex afecta a indexación.
No son lo mismo.
Si bloqueas una URL con robots.txt, Google puede no ver una etiqueta noindex dentro de esa página.
Copiar robots.txt de otra web
Un archivo robots.txt debe responder a la estructura de tu sitio.
Copiar el de otra web puede bloquear rutas que tú necesitas o dejar abiertas zonas que querías controlar.
Cada WordPress tiene su mezcla: tema, plugins, URLs, idioma, tienda, blog, filtros, buscador interno, sitemaps y estructura.
No todos necesitan las mismas reglas.
No declarar el sitemap correcto
Declarar el sitemap en robots.txt puede ayudar a los rastreadores a encontrarlo.
Pero si la URL del sitemap está mal, no aporta nada.
Revisa que carga, que no devuelve error y que contiene URLs correctas.
Robots.txt en tiendas WooCommerce
En tiendas WooCommerce, robots.txt puede requerir algo más de atención.
Una tienda puede generar muchas URLs con filtros, parámetros, búsquedas internas, ordenaciones o paginaciones.
Eso no significa que haya que bloquear media tienda sin pensar.
Antes de añadir reglas, conviene revisar:
- Si los filtros generan URLs rastreables.
- Si hay parámetros innecesarios.
- Si las categorías importantes son accesibles.
- Si los productos se pueden rastrear correctamente.
- Si el sitemap incluye productos y categorías útiles.
- Si hay problemas de contenido duplicado por filtros u ordenaciones.
En WooCommerce es fácil querer solucionar todo con robots.txt.
Pero no siempre es la mejor herramienta.
A veces el problema se arregla mejor con canonicals, noindex en determinadas plantillas, ajustes de filtros, estructura de categorías o mejora del enlazado interno.
Cómo revisar robots.txt en Search Console
Google Search Console puede ayudarte a detectar problemas relacionados con rastreo, indexación y robots.txt.
No se trata solo de mirar el archivo y decir “parece bien”.
Conviene revisar si Google está encontrando bloqueos donde no debería.
Puedes mirar:
- Informes de indexación.
- URLs marcadas como bloqueadas por robots.txt.
- Inspección de URLs concretas.
- Estado del sitemap.
- Errores o avisos de rastreo.
Si una URL importante aparece como bloqueada por robots.txt, toca revisar la regla exacta que lo está provocando.
Y si una URL aparece en Google aunque esté bloqueada por robots.txt, recuerda el matiz: bloquear rastreo no siempre equivale a eliminar del índice.
Checklist básica para revisar robots.txt
Antes de tocar nada, puedes revisar esta lista:
- El archivo carga correctamente en
/robots.txt. - No hay un
Disallow: /activo en una web publicada. - No se bloquean páginas importantes.
- No se bloquean recursos necesarios para renderizar la web.
- La URL del sitemap es correcta.
- No se usa
noindexdentro de robots.txt. - No se confía en robots.txt para proteger contenido privado.
- No hay reglas heredadas de una web antigua.
- Search Console no muestra avisos raros de bloqueo.
- Los cambios se han probado antes de dejarlos definitivos.
Consejo ideaWeb: después de modificar robots.txt, revisa varias URLs importantes en Search Console. No basta con guardar el archivo y cruzar los dedos.
Cuándo pedir ayuda si Google no rastrea bien tu WordPress
Puedes revisar un robots.txt sencillo por tu cuenta si sabes lo que estás mirando.
Pero merece la pena pedir ayuda cuando:
- La web ha dejado de aparecer en Google después de una migración.
- Search Console muestra avisos de bloqueo por robots.txt.
- Has rediseñado la web y el tráfico ha caído.
- Tu WordPress tiene Yoast, Rank Math u otro plugin SEO y no sabes qué está generando el archivo.
- La web tiene WooCommerce, filtros, parámetros o muchas URLs.
- No sabes si debes usar robots.txt, noindex o canonical.
- Vas a publicar una web que estuvo bloqueada durante el desarrollo.
- Has tocado DNS, hosting, migración o caché y ahora Google no rastrea bien.
En SEO técnico, a veces el problema no está donde parece.
Puede que robots.txt esté bien y el fallo sea un noindex heredado.
Puede que el sitemap esté mal.
Puede que una plantilla esté generando etiquetas incorrectas.
Puede que un plugin SEO esté sobrescribiendo ajustes.
O puede que alguien, hace dos años, pegara una regla “temporal” que se quedó a vivir en la web como un mueble viejo.
Cómo podemos ayudarte en ideaWeb
En ideaWeb podemos revisar tu archivo robots.txt dentro de una revisión más amplia de SEO técnico y mantenimiento WordPress.
Podemos comprobar:
- Archivo robots.txt físico o virtual.
- Reglas
AllowyDisallow. - Sitemap XML.
- Configuración de Yoast, Rank Math u otros plugins SEO.
- Etiquetas noindex.
- Canonicals.
- Errores de Search Console.
- Problemas de rastreo en WordPress.
- Bloqueos después de migraciones o rediseños.
- Configuraciones especiales en WooCommerce.
Si tu web no se está rastreando bien, no conviene tocar al azar.
Primero hay que saber si el problema está en robots.txt, en el sitemap, en las etiquetas de indexación, en el servidor, en WordPress o en una mezcla de todo.
Ahí es donde una revisión técnica puede ahorrar bastante tiempo.
¿Google no rastrea bien tu WordPress o aparecen avisos de robots.txt?
Podemos revisar robots.txt, sitemap, noindex, Search Console, plugins SEO y configuración de WordPress para detectar bloqueos, errores de rastreo o problemas de indexación.
Preguntas frecuentes sobre robots.txt en WordPress
¿Qué es robots.txt?
robots.txt es un archivo de texto que indica a los rastreadores qué partes de una web pueden o no pueden rastrear. Normalmente se encuentra en la raíz del dominio, en una URL como tudominio.com/robots.txt.
¿Es obligatorio tener robots.txt?
No. Una web puede funcionar sin un archivo robots.txt personalizado. Aun así, puede ser útil para declarar el sitemap o controlar determinadas zonas de rastreo.
¿robots.txt mejora el SEO?
No mejora posiciones por sí solo. Puede ayudar a gestionar mejor el rastreo y evitar errores, pero no es un truco directo para posicionar más alto.
¿Puedo usar robots.txt para ocultar páginas privadas?
No deberías. robots.txt es público y no protege contenido. Para páginas privadas conviene usar contraseña, permisos, autenticación o restricciones de servidor.
¿Bloquear una URL en robots.txt la elimina de Google?
No necesariamente. Bloquear una URL evita que se rastree, pero Google podría mostrarla si la descubre por enlaces. Para impedir indexación suele usarse noindex, siempre que Google pueda rastrear la página para verlo.
¿Dónde se edita robots.txt en WordPress?
Puede editarse mediante un archivo físico en la raíz del sitio o desde algunos plugins SEO como Yoast o Rank Math, según permisos y configuración. Antes de tocarlo conviene saber si tu web usa robots.txt físico o virtual.
¿Qué significa Disallow en robots.txt?
Disallow indica una ruta que los rastreadores no deberían rastrear. Por ejemplo, Disallow: /wp-admin/ indica que no se rastree esa carpeta.
¿Qué significa User-agent?
User-agent indica a qué robot o rastreador va dirigida una regla. User-agent: * se aplica de forma general a todos los rastreadores que respetan robots.txt.
¿Debo incluir el sitemap en robots.txt?
Es recomendable declarar la URL del sitemap XML si existe y está bien generado. Ayuda a los rastreadores a encontrar el mapa del sitio, aunque también puedes enviarlo desde Search Console.
¿ideaWeb puede revisar el robots.txt de mi web?
Sí. En ideaWeb podemos revisar robots.txt, sitemap, noindex, Search Console, plugins SEO y configuración WordPress para detectar bloqueos o errores de rastreo.
Qué es llms.txt y qué utilidad tiene para una web
Rank Math: qué es y por qué Rank Math Pro merece la pena en WordPress
Análisis SEO de una web: qué revisar antes de seguir tocando cosas
Qué es Google Search Console y para qué sirve
Qué necesita una página web para posicionar en Google
Optimizar WordPress: seguridad, velocidad y mantenimiento básico


