# llms.txt y robots.txt: cómo decirle a los rastreadores de IA qué pueden leer de tu sitio

> Para que la IA te recomiende, primero tiene que poder leerte. Dos archivos de texto en la raíz de tu sitio le dicen a los rastreadores qué pueden ver y cómo entenderte: robots.txt y llms.txt. Configurarlos bien es de las tareas más rápidas y de mayor impacto en AISO/GEO: el efecto se nota apenas el…

- Canonical: [https://blog.floe.com.ar/llms-txt-y-robots-txt-como-decirle-a-los-rastreadores-de-ia-que-pueden-leer/](https://blog.floe.com.ar/llms-txt-y-robots-txt-como-decirle-a-los-rastreadores-de-ia-que-pueden-leer/)

- Author: Juan Cufré

- Published: 2026-08-18T20:45:00+00:00

- Modified: 2026-07-14T19:52:48+00:00

Para que la IA te recomiende, primero tiene que poder leerte. Dos archivos de texto en la raíz de tu sitio le dicen a los rastreadores qué pueden ver y cómo entenderte: `robots.txt` y `llms.txt`. Configurarlos bien es de las tareas más rápidas y de mayor impacto en AISO/GEO: el efecto se nota apenas el rastreador vuelve a pasar.

### Qué hace cada archivo

`robots.txt` es un estándar consolidado. Su comportamiento quedó formalizado por la IETF en septiembre de 2022 como [RFC 9309, el Robots Exclusion Protocol](https://www.rfc-editor.org/rfc/rfc9309.html). Le indica a cada rastreador, identificado por su `User-agent`, qué rutas puede recorrer con reglas `Allow` y `Disallow`.

`llms.txt` es una propuesta más reciente, publicada el 3 de septiembre de 2024 por Jeremy Howard, de Answer.AI. La documentación oficial en [llmstxt.org](https://llmstxt.org/) explica el problema que resuelve: las ventanas de contexto de los modelos son chicas para procesar un sitio entero, y convertir HTML con menús, avisos y JavaScript a texto plano es difícil e impreciso. El archivo ofrece un resumen curado en Markdown, pensado para que un modelo lo consuma en el momento en que un usuario pide información.

### Los rastreadores de IA que te importan

Cada plataforma usa sus propios agentes, y cada uno cumple una función distinta. Estos son los principales tokens que vas a querer contemplar en tu `robots.txt`, según la documentación oficial:

User-agentPlataformaPara qué se usaGPTBotOpenAIEntrenamiento de modelosOAI-SearchBotOpenAIBúsqueda dentro de ChatGPTChatGPT-UserOpenAINavegación pedida por el usuarioGoogle-ExtendedGoogleEntrenamiento de Gemini y groundingPerplexityBotPerplexityIndexación para respuestas con fuentesClaudeBotAnthropicEntrenamiento y navegación

### Cada ajuste es independiente

Un detalle importante que aclara la [documentación de OpenAI sobre sus rastreadores](https://platform.openai.com/docs/bots): los tokens funcionan por separado. Podés permitir `OAI-SearchBot` para aparecer en la búsqueda de ChatGPT y, al mismo tiempo, bloquear `GPTBot` si preferís que tu contenido no se use para entrenar modelos. Si bloqueás `OAI-SearchBot`, tu sitio deja de mostrarse en las respuestas de búsqueda de ChatGPT, aunque todavía puede aparecer como enlace de navegación. OpenAI aclara que un cambio en tu `robots.txt` puede tardar cerca de 24 horas en reflejarse en sus sistemas.

En el caso de Google, la [lista oficial de rastreadores](https://developers.google.com/search/docs/crawling-indexing/google-common-crawlers) aclara que `Google-Extended` controla si tu contenido se usa para entrenar Gemini y para el grounding, y deja claro que este token no afecta la inclusión de tu sitio en Google Search ni funciona como señal de posicionamiento. Es una decisión que podés tomar sin miedo a perder tu lugar en el buscador tradicional.

### Cómo permitir a los rastreadores de IA

Si querés aparecer en respuestas de IA, dejá que esos agentes entren. Un `robots.txt` que los habilita se ve así:

```
User-agent: GPTBot
Allow: /

User-agent: OAI-SearchBot
Allow: /

User-agent: Google-Extended
Allow: /

User-agent: PerplexityBot
Allow: /

Sitemap: https://tumarca.com/sitemap.xml
```

Incluir la línea `Sitemap` ayuda a que descubran todas tus URLs. Si preferís bloquear un agente puntual, reemplazá `Allow: /` por `Disallow: /` bajo ese user-agent.

### Cómo armar tu llms.txt

El archivo va en `https://tumarca.com/llms.txt` y sigue un formato preciso en Markdown, definido en la especificación oficial: un encabezado H1 con el nombre del sitio (la única sección obligatoria), una cita breve con el resumen, secciones libres opcionales y listas de enlaces bajo encabezados H2. Un ejemplo mínimo:

```
# Tu Marca

> Herramienta de atención al cliente por WhatsApp con IA en español.

## Páginas clave
- [Producto](https://tumarca.com/producto): qué hace y para quién.
- [Precios](https://tumarca.com/precios): planes y costos.
- [Preguntas frecuentes](https://tumarca.com/faq): dudas habituales.

## Optional
- [Contacto](https://tumarca.com/contacto)
```

La sección `Optional` tiene un significado especial en la especificación: sus enlaces se pueden omitir cuando el modelo necesita un contexto más corto. Usala para información secundaria. La propia documentación aclara que `llms.txt` convive con `robots.txt` y con el `sitemap.xml`: cada uno cumple un rol distinto y se complementan.

### Errores que te dejan afuera sin querer

- Un `Disallow: /` global heredado de un entorno de pruebas que quedó en producción.

- Bloquear carpetas de recursos (CSS, JS) que el rastreador necesita para entender la página.

- Olvidar la línea `Sitemap`, lo que deja páginas sin descubrir.

- Un `llms.txt` desactualizado que apunta a URLs que ya no existen.

### Cómo verificar

Abrí `tumarca.com/robots.txt` y `tumarca.com/llms.txt` en el navegador y confirmá que cargan el contenido esperado. Revisá también en las herramientas para desarrolladores que ninguna regla esté bloqueando recursos visibles de la página. La especificación de `llms.txt` recomienda un paso extra: expandí tu archivo con una herramienta que genere el contexto para el modelo y probá con varias IA si responden bien preguntas sobre tu contenido.

Este trabajo es la base de [la accesibilidad técnica](https://blog.floe.com.ar/la-ia-puede-leerte-accesibilidad-tecnica-que-el-modelo-no-rebote-en-tu-puerta/). Cuando el rastreador entra sin trabas, recién ahí pesan las señales de [validación de entidad](https://blog.floe.com.ar/como-la-ia-sabe-que-existis-backlinks-desde-fuentes-que-validan-tu-entidad/) y [autoridad y frescura](https://blog.floe.com.ar/la-ia-confia-en-vos-autoridad-y-frescura-las-senales-que-te-hacen-citable/). Si aparece un término que no conocés, tenés el [glosario AISO / GEO](https://blog.floe.com.ar/glosario-aiso-geo-los-terminos-clave-de-la-optimizacion-para-respuestas-de-ia/). El paso técnico que sigue es asegurarte de que tu contenido no dependa de JavaScript, algo que vemos en [renderizado y JavaScript](https://blog.floe.com.ar/renderizado-y-javascript-por-que-tu-sitio-puede-quedar-invisible-para-la-ia/).

### Fuentes

- [RFC 9309, Robots Exclusion Protocol](https://www.rfc-editor.org/rfc/rfc9309.html) (IETF, 2022).

- [Especificación de llms.txt](https://llmstxt.org/) (Jeremy Howard, Answer.AI, 2024).

- [Overview of OpenAI Crawlers](https://platform.openai.com/docs/bots) (OpenAI).

- [Lista de rastreadores comunes de Google](https://developers.google.com/search/docs/crawling-indexing/google-common-crawlers) (Google).
