En alguna propuesta de agencia, o en un hilo de Slack de tu propio equipo, se cuela esta frase: para la IA, lo primero es poner un archivo llms.txt.
Suele venir con una explicación de una línea: es el robots.txt de la IA. Y así contado, cuesta encontrarle el pero.
Es un archivo. Cinco minutos. A Hex-ko también le pasó: lo subió pensando que no costaba nada, la misma lógica que la mochila de emergencia que tienes en el armario y nunca has abierto.
Pero queda una duda de lo más básica.
Una vez subido, ¿alguien lo lee?
Y hay quien se ha puesto a responderla en serio, con los registros de servidor de 137.000 webs. Vamos a verlo.
¿Y para qué servía exactamente el llms.txt?
El es un archivo de texto que se coloca en la raíz de la web (el nivel más alto, donde ya vive el robots.txt) con la lista de tus páginas importantes y sus resúmenes.
Dicho de otra forma: una nota para los modelos con un «lee por aquí».
Se propuso en 2024 y la idea recuerda a un mapa del sitio, pero escrito para la IA en vez de para Google.
Ahora bien, hay un detalle. Ninguna gran plataforma de IA se ha comprometido a leerlo.
Google ha ido más lejos y ha declarado abiertamente que sus sistemas de búsqueda no leen el llms.txt.
Y por eso no hay ningún mecanismo que convierta el «lo he subido» en «lo han leído». Ese es justo el hueco que vienen a llenar los registros.
137.000 webs pasadas por el escáner
El análisis lo firma Ahrefs, la empresa de herramientas de SEO, y se publicó en junio de 2026 (estudio).
El equipo reunió todos los dominios de su red de medición con tráfico en mayo de 2026 (137.210) y se fue a los .
Un registro de servidor es la anotación en bruto de quién vino a pedir qué archivo. No es una estimación ni un modelo: es la lista real de visitas. Y para la pregunta «¿esto lo ha leído alguien?», no hay mejor material.
Antes de los datos, un matiz que pesa. Ahrefs vende herramientas de SEO, así que «el SEO clásico sigue funcionando» le viene bien como conclusión.
La propia empresa avisa de que su medición se inclina hacia las webs que usan sus productos. Así que el 28% de adopción que verás ahora es, más bien, un techo.
Con eso encima de la mesa, los números.
- Dominios con un llms.txt válido publicado: 28% (unos 38.360)
- De esos, los que no recibieron ni una petición en mayo de 2026: 97%
- Los que recibieron alguna: 3% (unos 1.100)
En más de nueve de cada diez archivos, ese mes no pasó nadie. Ni una sola vez.
¿Y ese 3%, quién lo pedía?
Aquí la cosa se pone interesante.
El 96% de esas peticiones venía de bots. Los humanos fueron el 4%.
Y de los bots, solo el 19,5% se pudo identificar como relacionado con la IA. El 77% restante eran programas que no tienen nada que ver con la IA.
De hecho, un 12% de ellos eran herramientas de SEO comprobando que el llms.txt estuviera bien puesto.
Casi un chiste: el público principal del archivo es el software que verifica que el archivo existe.
Si abrimos la parte de IA, el reparto queda así.
- Agentes de IA e infraestructura de agentes: 10,5%
- Rastreadores de entrenamiento de modelos: 5,3%
- Asistentes de IA: 2,5%
- Bots de recuperación de la búsqueda con IA: 1,1%
En detalle, GPTBot pesa un 4,51% y ClaudeBot un 0,80%.
Pero el dato que zanja el asunto es otro.
En las webs sin llms.txt, ni un solo bot de IA fue a buscar uno.
Nadie llama a esa puerta. Y si nadie llama, poner una puerta no te trae visitas.
Mientras tanto, las instalaciones se multiplicaron por 8,8
Del lado de las webs, el movimiento va justo al revés.
Originality.ai siguió más de tres millones de webs durante doce meses: los llms.txt instalados pasaron de 4.088 a 36.120. Multiplicado por 8,8 en un año.
Sus parientes cercanos (llms-full.txt, ai.txt) crecieron alrededor de cien veces, aunque partían de bases tan pequeñas que el multiplicador engaña.
La expectativa de quien publica se ha adelantado bastante a lo que los motores se han comprometido a hacer. Ese desfase pocas veces se ve tan claro en cifras.
Si la cosa acabara aquí, esto sería un artículo deprimente. Pero lo que a Hex-ko le interesó de verdad empieza justo ahora: los mismos registros tienen una segunda mitad.
Entonces, ¿dónde viene a leer la IA?
Hasta ahora hemos hablado del archivo que nadie descarga. Vamos con el que descarga todo el mundo.
El mismo análisis muestra que los rastreadores de la búsqueda con IA se descargan directamente el de las webs.
El HTML es la página en sí, lo que ve una persona en el navegador. Es decir, los modelos van exactamente al mismo sitio que tus clientes.
Y eso mueve la pregunta entera. Si quieres que la IA lea algo, el sitio donde ponerlo no es un archivo aparte: es la página.
Lo bueno es que así la comprobación se vuelve muy concreta.
- ¿Tus páginas principales se pueden descargar siquiera?
- ¿El contenido está estructurado de forma legible para un modelo?
- ¿Alguien habla de ti fuera de tu propio dominio?
De los dos primeros puntos ya tenemos números. Casi un tercio de las fichas de producto resultó invisible para el tráfico de compra que llega desde la IA.
Y añadir fuentes y estadísticas movió la probabilidad de cita entre un 30% y un 40%.
Visto lo que dicen los registros, ordenar lo que ya publicas parece el camino más corto.
Conclusión: ordena las páginas que ya tienes y luego mide
Nada de esto convierte el llms.txt en un error. Es una idea razonable que los motores no han recogido. Todavía, quizá.
Pero hoy, con los registros en la mano, los rastreadores están en tu HTML. Y la atención es limitada, así que ahí conviene ponerla.
Empieza por comprobar que tus páginas importantes se pueden descargar y leer. Antes de buscar el próximo archivo que poner para la IA, asegúrate de que lo que ya está publicado se lee bien.
Y luego mira si se mueve algo: cuántas veces sale tu nombre en las respuestas de la IA y qué páginas tuyas se citan. Ordenar lo de casa es poco espectacular, sí. Suele ser justo lo que acaba funcionando.
Fuentes
- Ahrefs (Louise Linehan), «We Analyzed 137K Sites: 97% of llms.txt Files Never Get Read», 15 de junio de 2026, ahrefs.com (registros de servidor de Ahrefs Web Analytics / Bot Analytics sobre 137.210 dominios con tráfico en mayo de 2026. Tras comprobar que un llms.txt en la raíz devolviera HTTP 200 con Markdown real, el 28% de los dominios (unos 38.360) publicaba un archivo válido; el 97% de ellos no recibió ninguna petición en mayo de 2026 y el 3% (unos 1.100) recibió alguna. De ese 3%: 96% bots y 4% humanos; entre los bots, 19,5% relacionados con la IA y 77% herramientas ajenas a la IA, de las cuales un 12% eran herramientas de SEO que auditan el llms.txt. Reparto de la IA: agentes e infraestructura de agentes 10,5%, rastreadores de entrenamiento 5,3%, asistentes de IA 2,5%, bots de recuperación de la búsqueda con IA 1,1%. Bots identificados: GPTBot 4,51%, ClaudeBot 0,80%, DeepseekBot 0,02%. Cero casos de bots de IA pidiendo un llms.txt inexistente. Google declara que sus sistemas de búsqueda no leen el llms.txt. Los rastreadores de la búsqueda con IA descargan directamente el HTML, y el estudio concluye que la inversión corresponde a la legibilidad, la estructura y la autoridad del HTML. Limitación: Ahrefs es proveedor de herramientas de SEO, con interés en la conclusión de que «el SEO clásico funciona», y su medición se inclina hacia las webs de sus propios usuarios; la propia empresa señala que el 28% de adopción es un techo.)
- Seguimiento de doce meses de Originality.ai (más de 3 millones de webs, de junio de 2025 a mayo de 2026). Cobertura: PPC Land, «llms.txt adoption rises 8.8x but 97% of files get zero AI requests», junio de 2026, ppc.land (las webs con llms.txt pasaron de 4.088 en junio de 2025 a 36.120 en mayo de 2026, por 8,8. El llms-full.txt pasó de 23 a 2.463 webs (por 107,1) y el ai.txt de 4 a 397 (por 99,3). Los tres formatos suman 38.980 webs, y el llms.txt representa el 92,7% de las implementaciones.)