Logo de The Byteland

Guía para optimizar tu web para agentes de inteligencia artificial

Adrián Jiménez Martín

Adrián Jiménez Martín

19 de julio de 2026

ProgramaciónTecnologíaIA

Cada vez más agentes de IA, asistentes y crawlers especializados recorren la web en busca de contenido. Para facilitarles el trabajo han surgido nuevos estándares como llms.txt, llms-full.txt, ai.txt y .well-known/ai.txt. Te explico qué es cada uno, cómo crearlos y qué ventajas pueden aportar a tu sitio web.

Introducción

Si tienes un sitio web probablemente ya conoces robots.txt y los sitemaps, archivos que ayudan a los buscadores tradicionales a indexar tu contenido. Pero en los últimos años ha surgido un nuevo ecosistema: los agentes de inteligencia artificial que recorren la web para responder preguntas, alimentar modelos de lenguaje o asistir a programadores en sus editores de código.

Para estos agentes han aparecido nuevos estándares que permiten comunicar de forma clara qué contenido queremos que consuman, cómo deben hacerlo y si permitimos que nuestros textos se utilicen para entrenar modelos. Hoy voy a hablarte de cuatro de ellos: llms.txt, llms-full.txt, ai.txt y /.well-known/ai.txt.

¿Qué es llms.txt?

Propuesto por Jeremy Howard en septiembre de 2024, llms.txt es un archivo Markdown que se coloca en la raíz del dominio y actúa como un índice curado para modelos de lenguaje. Su objetivo es ofrecer a un agente de IA un mapa limpio y organizado de las páginas más importantes del sitio, evitando que tenga que crawlear todo el dominio para encontrar lo relevante.

Formato

El archivo debe colocarse en https://ejemplo.com/llms.txt y sigue esta estructura:

  • Un H1 con el nombre del sitio
  • Un blockquote con un resumen de una o dos líneas
  • Secciones con H2 que agrupan los enlaces por temática
  • Enlaces en formato Markdown con una descripción breve
llms.txt
# Mi Sitio Web
> Blog personal con tutoriales de desarrollo web, ciencia y tecnología.
>
Escrito por Juan Pérez.

El contenido principal son guías prácticas y artículos de opinión
sobre programación y tecnología en general.

## Artículos de programación
- [Guía de Vue 3](/vue-guide): Tutorial completo de Vue 3
- [Tailwind CSS desde cero](/tailwind-css): Introducción a utilidades CSS
- [SEO con schema.org](/seo-schema): Cómo implementar datos estructurados

## Páginas principales
- [Inicio](/): Página principal
- [Blog](/blog): Listado completo de artículos
- [Sobre mí](/about): Información del autor

Cada enlace debe ser una URL absoluta o relativa y debe llevar una descripción que ayude al modelo a entender qué encontrará al seguir ese enlace.

¿Para qué sirve?

Los asistentes de IA como Claude, ChatGPT o las herramientas integradas en editores de código (Cursor, Windsurf, Continue) pueden leer este archivo para entender rápidamente la estructura del sitio sin tener que hacer múltiples peticiones. Es especialmente útil para sitios con mucha documentación técnica o catálogos extensos de contenido.

¿Qué es llms-full.txt?

Si llms.txt es el índice, llms-full.txt es el corpus completo. Es un archivo compañero que contiene el texto íntegro de las páginas referenciadas en llms.txt, todo concatenado en un solo documento Markdown.

Formato

Se coloca en https://ejemplo.com/llms-full.txt y no tiene una estructura fija más allá de ser Markdown válido. La convención más extendida es separar cada página con un H2 que indique la URL y el título original:

llms-full.txt
# Mi Sitio Web - Contenido completo

## https://ejemplo.com/vue-guide
### Guía de Vue 3

Vue 3 es un framework progresivo de JavaScript para construir interfaces de usuario...

(contenido completo del artículo)

## https://ejemplo.com/tailwind-css
### Tailwind CSS desde cero

Tailwind CSS es un framework de utilidades que acelera el desarrollo...

(contenido completo del artículo)

Ventajas y consideraciones

La principal ventaja es que el agente obtiene todo el contenido en una sola petición HTTP, sin necesidad de seguir cada enlace individualmente. Esto es especialmente útil para herramientas de edición de código y asistentes que operan con ventanas de contexto limitadas.

Sin embargo, tienes que valorar si quieres tener todo el contenido de tu web expuesto en un único archivo. Puede llegar a ser muy grande (varios megabytes) y, al ser un solo fichero, cualquier persona o bot puede descargarlo entero. Si esto te preocupa, puedes limitarte a publicar solo llms.txt, que sigue siendo útil sin exponer el contenido completo.

💡 Consejo: Si decides publicar ambos, genera llms-full.txt automáticamente desde tu pipeline de construcción para que siempre esté actualizado.

¿Qué es ai.txt en la raíz?

ai.txt es un archivo propuesto por Spawning.ai en 2023 que permite a los propietarios de sitios web declarar si su contenido puede utilizarse para entrenar modelos de inteligencia artificial. Es similar a robots.txt pero enfocado específicamente en el uso para entrenamiento, no en el acceso.

Formato

Se coloca en https://ejemplo.com/ai.txt y utiliza una sintaxis muy similar a robots.txt con directivas User-Agent, Allow y Disallow:

ai.txt
# ai.txt - Permisos para entrenamiento de IA
User-Agent: *
Allow: /

Valores posibles

  • Allow: Indica que permites que tu contenido se utilice para entrenamiento.
  • Disallow: Indica que NO permites el uso de tu contenido para entrenamiento.

Puedes restringir por tipo de contenido o rutas específicas:

ai.txt
# Permitir solo contenido público, denegar contenido premium
User-Agent: *
Allow: /blog/
Allow: /guides/
Disallow: /premium/
Disallow: /private/

También puedes segmentar por agente:

ai.txt
User-Agent: GPTBot
Allow: /

User-Agent: ClaudeBot
Disallow: /

Este formato es reconocido por la API de Spawning y lo respetan empresas como Hugging Face y Stability AI. Para el resto de agentes es una señal voluntaria, pero ayuda a dejar clara tu posición respecto al uso de tu contenido.

¿Qué es /.well-known/ai.txt?

A principios de 2026 se presentó un borrador en el IETF (el organismo que estandariza protocolos de internet) para un nuevo archivo: /.well-known/ai.txt. Es una evolución más completa del ai.txt de Spawning, con un formato más estructurado y capaz de expresar políticas matizadas que robots.txt no puede comunicar.

Ubicación

Debe servirse en https://ejemplo.com/.well-known/ai.txt sobre HTTPS y con Content-Type: text/plain; charset=utf-8.

Formato y propiedades

Utiliza un formato de bloques clave:valor inspirado en robots.txt y security.txt:

.well-known/ai.txt
# ai.txt - Declaración de política de IA
Spec-Version: 1.0
Site-Name: Mi Blog
Site-URL: https://ejemplo.com
Contact: ai@ejemplo.com
Policy-URL: https://ejemplo.com/politica-ia
Training: deny
Scraping: allow
Indexing: allow
Caching: allow
Training-License: CC-BY-4.0
Attribution: required

Agent: *
  Rate-Limit: 30/minute

Agent: GPTBot
  Training: allow
  Rate-Limit: 120/minute

Campos principales

  • Spec-Version: Versión de la especificación (actualmente 1.0).
  • Site-Name: Nombre del sitio.
  • Site-URL: URL canónica del sitio.
  • Contact: Dirección de contacto para temas de licencia o política de IA.
  • Policy-URL: Enlace a la política de IA en lenguaje humano.
  • Training: Indica si permites el entrenamiento de modelos con tu contenido. Valores: allow, deny (por defecto), conditional (activa reglas por ruta).
  • Scraping: Permite que los agentes lean tu contenido. Valores: allow (por defecto), deny.
  • Indexing: Permite que tu contenido aparezca en índices de IA. Valores: allow (por defecto), deny.
  • Caching: Permite que los agentes cacheen tu contenido. Valores: allow (por defecto), deny.
  • Training-License: Identificador SPDX de la licencia bajo la que se permite el entrenamiento (ej: CC-BY-4.0, MIT).
  • Attribution: Si se debe atribuir la fuente al usar el contenido. Valores: required, optional, none.

Bloques por agente

Dentro de un bloque Agent: se pueden sobrescribir las políticas por agente específico. El agente comodín * establece la política por defecto. Los campos más comunes dentro de un bloque de agente son:

  • Training, Scraping, Indexing, Caching: Sobrescriben los valores globales.
  • Rate-Limit: Límite de peticiones en formato N/ventana (ej: 30/minute, 100/hour, 1000/day).

Diferencias con robots.txt

Mientras que robots.txt solo puede permitir o bloquear el acceso a rutas, /.well-known/ai.txt permite expresar matices como "puedes crawlear mi sitio para indexarlo, pero no puedes entrenar modelos con mi contenido". Esto es útil si quieres aparecer en búsquedas de IA pero no quieres que tu contenido forme parte del dataset de entrenamiento de un modelo.

¿Merece la pena implementarlos?

La adopción de estos archivos es aún temprana, pero el coste de implementarlos es muy bajo: son archivos de texto estáticos que apenas ocupan espacio. A día de hoy:

  • llms.txt es leído por asistentes de código como Cursor y Continue. Su valor actual está más en herramientas de desarrollo que en buscadores de IA, pero tenerlo te coloca en una buena posición cuando la adopción crezca.
  • llms-full.txt es opcional y útil si tienes documentación técnica densa. Si te preocupa exponer todo tu contenido, puedes prescindir de él.
  • ai.txt (Spawning) es respetado por actores concretos del ecosistema de entrenamiento.
  • /.well-known/ai.txt es el más completo y está en proceso de estandarización en el IETF. Permite expresar políticas con mucho más detalle que cualquier otro formato.

Mi recomendación es empezar por llms.txt y ai.txt (en la raíz), que son los más sencillos. Si necesitas más control, añade /.well-known/ai.txt. Y si tu web tiene mucha documentación técnica, valora si llms-full.txt tiene sentido para ti.

Conclusión

Los archivos llms.txt, llms-full.txt, ai.txt y /.well-known/ai.txt son la nueva capa de comunicación entre los sitios web y los agentes de inteligencia artificial. Aunque ninguno es obligatorio ni está universalmente adoptado, implementarlos es una inversión de futuro con coste casi nulo.

Si ya tienes un robots.txt y un sitemap, añadir estos archivos es el siguiente paso natural para que tu web sea correctamente interpretada tanto por buscadores tradicionales como por el creciente ecosistema de agentes de IA.

Referencias

¿Quieres comentar algo sobre este artículo?