# RAG y herramientas: cómo la IA busca, cita y trabaja con datos frescos

> A esta altura de la serie ya sabés que un modelo tiene el conocimiento congelado en su fecha de entrenamiento y que, cuando no sabe algo, tiende a inventar la continuación más plausible. La solución que la industria adoptó para las dos cosas es la misma: darle al modelo acceso a información externa en el…

- Canonical: [https://blog.floe.com.ar/rag-y-herramientas-como-la-ia-busca-cita-y-trabaja-con-datos-frescos/](https://blog.floe.com.ar/rag-y-herramientas-como-la-ia-busca-cita-y-trabaja-con-datos-frescos/)

- Author: Juan Cufré

- Published: 2026-07-26T13:00:00+00:00

- Modified: 2026-07-14T19:52:48+00:00

A esta altura de la serie ya sabés que un modelo tiene el conocimiento congelado en su fecha de entrenamiento y que, cuando no sabe algo, tiende a inventar la continuación más plausible. La solución que la industria adoptó para las dos cosas es la misma: darle al modelo acceso a información externa en el momento de responder. Esa idea tiene un nombre, RAG, y abre la puerta a que la IA use herramientas. Con este cierre de la serie IA por dentro conectamos toda la mecánica interna con lo que hacés cuando querés que la IA hable bien de tu marca.

### Qué es RAG

RAG son las siglas de generación aumentada por recuperación (retrieval-augmented generation). La formalizaron Lewis y colegas en 2020 y la idea es simple de explicar: antes de que el modelo escriba la respuesta, un sistema de búsqueda recupera fragmentos de texto relevantes y se los pega en el contexto. El modelo genera apoyado en esos fragmentos, con datos que puede no haber visto nunca durante el entrenamiento.

El flujo típico tiene estos pasos:

- La pregunta del usuario se convierte en un embedding (un vector), igual que vimos en el artículo de tokens y embeddings.

- Ese vector se compara contra una base de documentos ya vectorizados y se traen los más cercanos por similitud.

- Los fragmentos recuperados se insertan en el prompt junto con la pregunta.

- El modelo redacta la respuesta basándose en ese material, y puede citar de dónde salió.

### Por qué RAG reduce las alucinaciones

En el artículo anterior vimos que el modelo inventa cuando tiene que completar sin información firme. RAG ataca esa raíz: le pone información firme adelante. Cuando el texto correcto está dentro de la ventana de contexto, el modelo tiene algo concreto en que apoyarse y la respuesta queda anclada (grounded) a una fuente. Esto además habilita las citas, porque el sistema sabe qué documento aportó cada dato.

La búsqueda por similitud se apoya en la geometría del espacio de embeddings. Dos textos que hablan de lo mismo quedan cerca en ese espacio aunque usen palabras distintas, y por eso el recuperador encuentra el pasaje relevante incluso cuando la pregunta está redactada de otra manera.

### De recuperar a actuar: el uso de herramientas

RAG recupera texto. El paso siguiente es dejar que el modelo ejecute acciones. Con el uso de herramientas (tool use o function calling), el modelo puede emitir una llamada estructurada a una función externa: consultar una API, buscar en la web, correr un cálculo, leer una base de datos. El sistema ejecuta esa llamada, le devuelve el resultado y el modelo sigue redactando con ese dato fresco.

Así es como un asistente te da el clima de hoy, el precio actual de algo o el estado de un pedido, cosas imposibles para un modelo que solo tira de su memoria congelada. El modelo aporta el razonamiento lingüístico; las herramientas aportan los hechos verificables y actualizados.

### Qué tiene que ver esto con tu marca

Acá cierra el círculo con todo lo que trabajamos en el blog. Cuando un buscador con IA o un asistente responde una pregunta sobre tu rubro, muchas veces está haciendo RAG: recupera contenido de la web y redacta sobre esa base. Si tu contenido está bien estructurado, es claro y responde preguntas reales, tenés más chances de ser el fragmento que el sistema recupera y cita.

Eso es exactamente lo que trabajamos en la serie AISO. Entender la mecánica interna te ayuda a escribir para que estos sistemas te encuentren y te elijan. Dos puntos de entrada:

- [Cómo la IA entiende tu contenido](https://blog.floe.com.ar/la-ia-te-entiende-contenido-y-semantica-para-que-la-ia-te-recomiende/), la contracara semántica de los embeddings que vimos acá.

- [Cómo la IA sabe que existís](https://blog.floe.com.ar/como-la-ia-sabe-que-existis-autoridad-y-backlinks-para-que-la-ia-te-cite/), sobre autoridad y las señales que hacen que te cite.

Este artículo cierra la serie que empezó con [qué es un modelo de lenguaje](https://blog.floe.com.ar/como-aprende-a-hablar-una-maquina-que-es-un-modelo-de-lenguaje/) y siguió por [por qué la IA alucina](https://blog.floe.com.ar/por-que-la-ia-alucina-inferencia-ventana-de-contexto-y-temperatura/). Ahora tenés el mapa completo de por qué la IA funciona como funciona hoy.

### Fuentes

- Lewis et al. (2020), [Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks](https://arxiv.org/abs/2005.11401), NeurIPS.
