llms.txt y robots.txt: cómo decirle a los rastreadores de IA qué pueden leer de tu sitio

Para que la IA te recomiende, primero tiene que poder leerte. Dos archivos de texto en la raíz de tu sitio le dicen a los rastreadores qué pueden ver y cómo entenderte: robots.txt y llms.txt. Configurarlos bien es de las tareas más rápidas y de mayor impacto en AISO/GEO: el efecto se nota apenas el rastreador vuelve a pasar.

Qué hace cada archivo

robots.txt es un estándar consolidado. Su comportamiento quedó formalizado por la IETF en septiembre de 2022 como RFC 9309, el Robots Exclusion Protocol. Le indica a cada rastreador, identificado por su User-agent, qué rutas puede recorrer con reglas Allow y Disallow.

llms.txt es una propuesta más reciente, publicada el 3 de septiembre de 2024 por Jeremy Howard, de Answer.AI. La documentación oficial en llmstxt.org explica el problema que resuelve: las ventanas de contexto de los modelos son chicas para procesar un sitio entero, y convertir HTML con menús, avisos y JavaScript a texto plano es difícil e impreciso. El archivo ofrece un resumen curado en Markdown, pensado para que un modelo lo consuma en el momento en que un usuario pide información.

Los rastreadores de IA que te importan

Cada plataforma usa sus propios agentes, y cada uno cumple una función distinta. Estos son los principales tokens que vas a querer contemplar en tu robots.txt, según la documentación oficial:

User-agentPlataformaPara qué se usa
GPTBotOpenAIEntrenamiento de modelos
OAI-SearchBotOpenAIBúsqueda dentro de ChatGPT
ChatGPT-UserOpenAINavegación pedida por el usuario
Google-ExtendedGoogleEntrenamiento de Gemini y grounding
PerplexityBotPerplexityIndexación para respuestas con fuentes
ClaudeBotAnthropicEntrenamiento y navegación

Cada ajuste es independiente

Un detalle importante que aclara la documentación de OpenAI sobre sus rastreadores: los tokens funcionan por separado. Podés permitir OAI-SearchBot para aparecer en la búsqueda de ChatGPT y, al mismo tiempo, bloquear GPTBot si preferís que tu contenido no se use para entrenar modelos. Si bloqueás OAI-SearchBot, tu sitio deja de mostrarse en las respuestas de búsqueda de ChatGPT, aunque todavía puede aparecer como enlace de navegación. OpenAI aclara que un cambio en tu robots.txt puede tardar cerca de 24 horas en reflejarse en sus sistemas.

En el caso de Google, la lista oficial de rastreadores aclara que Google-Extended controla si tu contenido se usa para entrenar Gemini y para el grounding, y deja claro que este token no afecta la inclusión de tu sitio en Google Search ni funciona como señal de posicionamiento. Es una decisión que podés tomar sin miedo a perder tu lugar en el buscador tradicional.

Cómo permitir a los rastreadores de IA

Si querés aparecer en respuestas de IA, dejá que esos agentes entren. Un robots.txt que los habilita se ve así:

User-agent: GPTBot
Allow: /

User-agent: OAI-SearchBot
Allow: /

User-agent: Google-Extended
Allow: /

User-agent: PerplexityBot
Allow: /

Sitemap: https://tumarca.com/sitemap.xml

Incluir la línea Sitemap ayuda a que descubran todas tus URLs. Si preferís bloquear un agente puntual, reemplazá Allow: / por Disallow: / bajo ese user-agent.

Cómo armar tu llms.txt

El archivo va en https://tumarca.com/llms.txt y sigue un formato preciso en Markdown, definido en la especificación oficial: un encabezado H1 con el nombre del sitio (la única sección obligatoria), una cita breve con el resumen, secciones libres opcionales y listas de enlaces bajo encabezados H2. Un ejemplo mínimo:

# Tu Marca

> Herramienta de atención al cliente por WhatsApp con IA en español.

## Páginas clave
- [Producto](https://tumarca.com/producto): qué hace y para quién.
- [Precios](https://tumarca.com/precios): planes y costos.
- [Preguntas frecuentes](https://tumarca.com/faq): dudas habituales.

## Optional
- [Contacto](https://tumarca.com/contacto)

La sección Optional tiene un significado especial en la especificación: sus enlaces se pueden omitir cuando el modelo necesita un contexto más corto. Usala para información secundaria. La propia documentación aclara que llms.txt convive con robots.txt y con el sitemap.xml: cada uno cumple un rol distinto y se complementan.

Errores que te dejan afuera sin querer

  • Un Disallow: / global heredado de un entorno de pruebas que quedó en producción.
  • Bloquear carpetas de recursos (CSS, JS) que el rastreador necesita para entender la página.
  • Olvidar la línea Sitemap, lo que deja páginas sin descubrir.
  • Un llms.txt desactualizado que apunta a URLs que ya no existen.

Cómo verificar

Abrí tumarca.com/robots.txt y tumarca.com/llms.txt en el navegador y confirmá que cargan el contenido esperado. Revisá también en las herramientas para desarrolladores que ninguna regla esté bloqueando recursos visibles de la página. La especificación de llms.txt recomienda un paso extra: expandí tu archivo con una herramienta que genere el contexto para el modelo y probá con varias IA si responden bien preguntas sobre tu contenido.

Este trabajo es la base de la accesibilidad técnica. Cuando el rastreador entra sin trabas, recién ahí pesan las señales de validación de entidad y autoridad y frescura. Si aparece un término que no conocés, tenés el glosario AISO / GEO. El paso técnico que sigue es asegurarte de que tu contenido no dependa de JavaScript, algo que vemos en renderizado y JavaScript.

Fuentes