>_ no-gui.comGet started →
← Data & Evidence
GEOllms.txtinvestigaciónevidencia

llms.txt no funciona: tres estudios y 137,000 sitios lo confirman

No GUI Research · September 8, 2026 · 1,184 words

El 97% de los archivos llms.txt nunca recibieron una visita de bots de IA. Tres estudios independientes cierran el debate sobre el formato. Lo que sí produce resultados: contenido estructurado con estadísticas, citas de expertos y respuesta directa al inicio del documento.

Conceptos clave: llms.txt · Generative Engine Optimization (GEO) · SDSR · RAG · citación orgánica en IA

Estudio Muestra Hallazgo principal
Ahrefs 137,000 dominios 97% de archivos llms.txt: cero visitas de bots de IA
OtterlyAI 62,100 peticiones de bots (90 días) Solo 0.1% llegaron a /llms.txt
Allmo.ai Top 50 dominios más citados globalmente 0% tenían llms.txt activo

¿Qué es llms.txt y qué prometía?

llms.txt es un archivo Markdown en la raíz de un sitio web diseñado para que los modelos de lenguaje lo lean como resumen del sitio. La promesa era simple: dale a la IA una guía limpia de tu contenido y te citará más.

Jeremy Howard (Answer.AI) lo propuso en septiembre de 2024 pensando en herramientas de desarrollo como Cursor, Windsurf y Claude Code — asistentes de programación que necesitan navegar documentación técnica sin procesar HTML pesado. El formato fue pensado para que un desarrollador le diga a su IDE “aquí está la documentación de mi librería en formato limpio”.

El problema surgió cuando el ecosistema del marketing digital lo adoptó como solución de visibilidad en IA generativa — un caso de uso para el que nunca fue diseñado.

Plataformas como OpenAI, Google y Anthropic ya tienen sus propios pipelines de extracción HTML que limpian el código, eliminan anuncios y extraen el texto principal de forma automática. Aceptar un archivo no verificado que el dueño del sitio puede manipular libremente introduciría riesgos de manipulación directa que ningún laboratorio serio puede tolerar.


Los tres estudios que cierran el debate

Ahrefs: 137,000 dominios, 90 días

El 97% de los archivos llms.txt analizados recibieron exactamente cero visitas de bots de IA.

Ahrefs auditó 137,000 sitios web con el archivo activo. Del 3% que sí recibió alguna petición, el 96% provino de bots de auditoría de infraestructura como BuiltWith — no de motores generativos. El tráfico real de herramientas de IA provino casi en su totalidad de asistentes de código como Claude Code, confirmando el propósito original del formato.

Hallazgo adicional: ningún bot de IA buscó un archivo llms.txt en un sitio que no lo tuviese publicado previamente. No hay exploración proactiva del formato.

OtterlyAI: 62,100 peticiones de bots, 90 días

De 62,100 peticiones registradas de bots de modelos de lenguaje, solo 84 llegaron a /llms.txt — el 0.1% del total.

OtterlyAI monitoreó el tráfico de bots de IA durante tres meses en dominios con el archivo activo. El resultado más revelador: /llms.txt tuvo tres veces menos tráfico que cualquier página HTML estándar del mismo dominio. El archivo “especial para IA” recibe menos atención de los bots que un artículo ordinario.

Allmo.ai: Top 50 dominios más citados en el mundo

Solo 1 de los 50 dominios más citados globalmente por motores de IA tenía llms.txt. En el Top 20 de medios con más citas: 0%.

Allmo.ai cruzó los dominios con mayor frecuencia de aparición en respuestas de ChatGPT, Perplexity y Gemini contra la presencia de llms.txt. La conclusión es directa: no existe correlación estadística entre tener el archivo y ser citado. Los dominios más referenciados del mundo llegaron a esa posición sin él.


El experimento cats.txt: cómo se fabricaron las métricas de éxito

Mark Williams-Cook (Search Engine Journal) demostró que los cuatro indicadores usados para vender llms.txt como efectivo son métricas vacías.

Williams-Cook creó cats.txt — un archivo con datos completamente ficticios sobre gatos de oficina, incluyendo estadísticas inventadas de productividad felina. El archivo superó los cuatro “puntos de prueba” que agencias y herramientas presentaban como evidencia de que llms.txt funciona:

  1. ✅ Apareció en los logs del servidor cuando un bot lo descargó
  2. ✅ Fue indexado por Google
  3. ✅ ChatGPT devolvió sus datos cuando se le preguntó directamente por la URL
  4. ✅ ChatGPT afirmó vía prompt que “el archivo ayuda a mejorar la visibilidad del sitio”

Ninguno de estos puntos prueba preferencia de citación orgánica en búsquedas reales. Solo confirman que un archivo de texto plano es accesible por HTTP y que un LLM puede leer lo que se le apunta directamente. Exactamente lo que cualquier página HTML ordinaria haría.


Lo que sí funciona: SDSR y la Plantilla GEO Atómica

La investigación académica con evidencia empírica real apunta a dos estrategias concretas, ninguna de ellas basada en archivos silenciosos.

SDSR — Self-Describing Structured Retrieval

Precisión RAG: +29.6% en sistemas estándar, +29.8% en arquitecturas multi-salto (arXiv:2604.19777)

Los Transformers tienen primacy bias: el contenido que aparece al inicio del documento recibe mayor atención y tiene más probabilidad de ser citado. SDSR explota este comportamiento posicionando información clave antes que cualquier otro elemento.

Regla de implementación: cada página comienza con (1) resumen ejecutivo de 2-3 oraciones, (2) lista de 3-5 conceptos clave, (3) dato cuantitativo o tabla principal. El desarrollo sigue después. Nunca al revés.

Plantilla GEO Atómica

Visibilidad de citación: +30% a +40% (Aggarwal et al., Princeton/ACM SIGKDD 2024, GEO-bench, n=10,000 consultas)

Cada sección de contenido debe seguir este orden exacto:

  1. Respuesta directa → La conclusión en 1-2 oraciones, sin preámbulos
  2. Dato estadístico → Un número concreto con fuente atribuida
  3. Cita de experto → Declaración de tercero con nombre y cargo
  4. Párrafo explicativo → Contexto, matices, implicaciones
Técnica Incremento en visibilidad de citación
Citas de fuentes atribuidas +34.4%
Estadísticas cuantitativas +32.1% a +37.0%
Citas directas de expertos +29.7%
Keywords repetitivas (SEO viejo) Mínimo a negativo
JSON-LD aislado +0.17 (irrelevante)

El dato más importante para marcas que no son líderes del mercado: sitios en posición 4-5 de Google que aplicaron GEO lograron +115% de visibilidad en respuestas generativas. Los modelos priorizan la calidad del fragmento extraído, no la autoridad histórica del dominio. Ese es el efecto democratizador de GEO — y es la razón por la que marcas medianas pueden superar a gigantes en las respuestas de la IA.


La conclusión

llms.txt resuelve un problema real — pero para desarrolladores que documentan software, no para marcas que quieren aparecer en ChatGPT o Perplexity.

El tiempo invertido en crear y mantener archivos llms.txt produce cero impacto medible en la citación orgánica. La misma inversión aplicada a estructurar el contenido existente con SDSR y la plantilla GEO atómica produce incrementos de entre el 30% y el 40%.

La evidencia es definitiva. El debate está cerrado.


¿Quieres saber cómo aparece tu marca en los modelos de IA hoy?

Fuentes: Ahrefs Crawl Analysis (n=137,000 dominios, 2026) · OtterlyAI Bot Traffic Report (n=62,100 peticiones, 90 días, 2026) · Allmo.ai Citation Analysis (Top 50 dominios globales, 2026) · Williams-Cook, M. “The cats.txt Experiment”, Search Engine Journal (2026) · Aggarwal et al. “GEO: Generative Engine Optimization”, Princeton/ACM SIGKDD 2024, arXiv:2311.09735 · arXiv:2604.19777 (SDSR Framework)

What's your AI visibility score?

Drop your URL. We'll generate your AML and run your first diagnostic.

Run my diagnostic →
llms.txt no funciona: la evidencia empírica (2026) | No GUI