No GUI Research · September 8, 2026 · 1,184 words
El 97% de los archivos llms.txt nunca recibieron una visita de bots de IA. Tres estudios independientes cierran el debate sobre el formato. Lo que sí produce resultados: contenido estructurado con estadísticas, citas de expertos y respuesta directa al inicio del documento.
Conceptos clave: llms.txt · Generative Engine Optimization (GEO) · SDSR · RAG · citación orgánica en IA
| Estudio | Muestra | Hallazgo principal |
|---|---|---|
| Ahrefs | 137,000 dominios | 97% de archivos llms.txt: cero visitas de bots de IA |
| OtterlyAI | 62,100 peticiones de bots (90 días) | Solo 0.1% llegaron a /llms.txt |
| Allmo.ai | Top 50 dominios más citados globalmente | 0% tenían llms.txt activo |
llms.txt es un archivo Markdown en la raíz de un sitio web diseñado para que los modelos de lenguaje lo lean como resumen del sitio. La promesa era simple: dale a la IA una guía limpia de tu contenido y te citará más.
Jeremy Howard (Answer.AI) lo propuso en septiembre de 2024 pensando en herramientas de desarrollo como Cursor, Windsurf y Claude Code — asistentes de programación que necesitan navegar documentación técnica sin procesar HTML pesado. El formato fue pensado para que un desarrollador le diga a su IDE “aquí está la documentación de mi librería en formato limpio”.
El problema surgió cuando el ecosistema del marketing digital lo adoptó como solución de visibilidad en IA generativa — un caso de uso para el que nunca fue diseñado.
Plataformas como OpenAI, Google y Anthropic ya tienen sus propios pipelines de extracción HTML que limpian el código, eliminan anuncios y extraen el texto principal de forma automática. Aceptar un archivo no verificado que el dueño del sitio puede manipular libremente introduciría riesgos de manipulación directa que ningún laboratorio serio puede tolerar.
El 97% de los archivos llms.txt analizados recibieron exactamente cero visitas de bots de IA.
Ahrefs auditó 137,000 sitios web con el archivo activo. Del 3% que sí recibió alguna petición, el 96% provino de bots de auditoría de infraestructura como BuiltWith — no de motores generativos. El tráfico real de herramientas de IA provino casi en su totalidad de asistentes de código como Claude Code, confirmando el propósito original del formato.
Hallazgo adicional: ningún bot de IA buscó un archivo llms.txt en un sitio que no lo tuviese publicado previamente. No hay exploración proactiva del formato.
De 62,100 peticiones registradas de bots de modelos de lenguaje, solo 84 llegaron a /llms.txt — el 0.1% del total.
OtterlyAI monitoreó el tráfico de bots de IA durante tres meses en dominios con el archivo activo. El resultado más revelador: /llms.txt tuvo tres veces menos tráfico que cualquier página HTML estándar del mismo dominio. El archivo “especial para IA” recibe menos atención de los bots que un artículo ordinario.
Solo 1 de los 50 dominios más citados globalmente por motores de IA tenía llms.txt. En el Top 20 de medios con más citas: 0%.
Allmo.ai cruzó los dominios con mayor frecuencia de aparición en respuestas de ChatGPT, Perplexity y Gemini contra la presencia de llms.txt. La conclusión es directa: no existe correlación estadística entre tener el archivo y ser citado. Los dominios más referenciados del mundo llegaron a esa posición sin él.
Mark Williams-Cook (Search Engine Journal) demostró que los cuatro indicadores usados para vender llms.txt como efectivo son métricas vacías.
Williams-Cook creó cats.txt — un archivo con datos
completamente ficticios sobre gatos de oficina, incluyendo estadísticas
inventadas de productividad felina. El archivo superó los cuatro “puntos
de prueba” que agencias y herramientas presentaban como evidencia de que
llms.txt funciona:
Ninguno de estos puntos prueba preferencia de citación orgánica en búsquedas reales. Solo confirman que un archivo de texto plano es accesible por HTTP y que un LLM puede leer lo que se le apunta directamente. Exactamente lo que cualquier página HTML ordinaria haría.
La investigación académica con evidencia empírica real apunta a dos estrategias concretas, ninguna de ellas basada en archivos silenciosos.
Precisión RAG: +29.6% en sistemas estándar, +29.8% en arquitecturas multi-salto (arXiv:2604.19777)
Los Transformers tienen primacy bias: el contenido que aparece al inicio del documento recibe mayor atención y tiene más probabilidad de ser citado. SDSR explota este comportamiento posicionando información clave antes que cualquier otro elemento.
Regla de implementación: cada página comienza con (1) resumen ejecutivo de 2-3 oraciones, (2) lista de 3-5 conceptos clave, (3) dato cuantitativo o tabla principal. El desarrollo sigue después. Nunca al revés.
Visibilidad de citación: +30% a +40% (Aggarwal et al., Princeton/ACM SIGKDD 2024, GEO-bench, n=10,000 consultas)
Cada sección de contenido debe seguir este orden exacto:
| Técnica | Incremento en visibilidad de citación |
|---|---|
| Citas de fuentes atribuidas | +34.4% |
| Estadísticas cuantitativas | +32.1% a +37.0% |
| Citas directas de expertos | +29.7% |
| Keywords repetitivas (SEO viejo) | Mínimo a negativo |
| JSON-LD aislado | +0.17 (irrelevante) |
El dato más importante para marcas que no son líderes del mercado: sitios en posición 4-5 de Google que aplicaron GEO lograron +115% de visibilidad en respuestas generativas. Los modelos priorizan la calidad del fragmento extraído, no la autoridad histórica del dominio. Ese es el efecto democratizador de GEO — y es la razón por la que marcas medianas pueden superar a gigantes en las respuestas de la IA.
llms.txt resuelve un problema real — pero para desarrolladores que documentan software, no para marcas que quieren aparecer en ChatGPT o Perplexity.
El tiempo invertido en crear y mantener archivos llms.txt produce cero impacto medible en la citación orgánica. La misma inversión aplicada a estructurar el contenido existente con SDSR y la plantilla GEO atómica produce incrementos de entre el 30% y el 40%.
La evidencia es definitiva. El debate está cerrado.
¿Quieres saber cómo aparece tu marca en los modelos de IA hoy?
Fuentes: Ahrefs Crawl Analysis (n=137,000 dominios, 2026) · OtterlyAI Bot Traffic Report (n=62,100 peticiones, 90 días, 2026) · Allmo.ai Citation Analysis (Top 50 dominios globales, 2026) · Williams-Cook, M. “The cats.txt Experiment”, Search Engine Journal (2026) · Aggarwal et al. “GEO: Generative Engine Optimization”, Princeton/ACM SIGKDD 2024, arXiv:2311.09735 · arXiv:2604.19777 (SDSR Framework)
What's your AI visibility score?
Drop your URL. We'll generate your AML and run your first diagnostic.
Run my diagnostic →