# Por qué la IA alucina: inferencia, ventana de contexto y temperatura

> La IA a veces afirma con total aplomo cosas que son falsas: inventa una cita, un dato o un artículo que nunca existió. A eso se le llama alucinación, y es una de las cosas que más desconcierta a quien empieza a usar estas herramientas. La alucinación es una consecuencia directa de cómo el modelo…

- Canonical: [https://blog.floe.com.ar/por-que-la-ia-alucina-inferencia-ventana-de-contexto-y-temperatura/](https://blog.floe.com.ar/por-que-la-ia-alucina-inferencia-ventana-de-contexto-y-temperatura/)

- Author: Juan Cufré

- Published: 2026-07-25T13:00:00+00:00

- Modified: 2026-07-14T19:52:48+00:00

La IA a veces afirma con total aplomo cosas que son falsas: inventa una cita, un dato o un artículo que nunca existió. A eso se le llama alucinación, y es una de las cosas que más desconcierta a quien empieza a usar estas herramientas. La alucinación es una consecuencia directa de cómo el modelo genera texto. En este artículo, el quinto de la serie IA por dentro, abrimos el momento de la inferencia (cuando el modelo produce la respuesta) y mostramos por qué inventar está inscrito en su mecánica.

### Inferencia: elegir una palabra entre muchas probables

Como vimos al principio de la serie, el modelo produce en cada paso una distribución de probabilidad sobre todo el vocabulario. Ahí no hay una respuesta única: hay una lista de candidatos con sus probabilidades. La inferencia es el arte de elegir uno. Ese paso de elección se llama muestreo (sampling) y define buena parte del carácter de la respuesta.

Las estrategias más comunes:

- **Greedy:** elegir siempre el token más probable. Da respuestas seguras y a veces monótonas.

- **Top-k:** muestrear solo entre los k candidatos más probables.

- **Top-p (nucleus):** muestrear entre los candidatos que juntan una probabilidad acumulada p. Holtzman y colegas (2019) mostraron que este método genera texto más natural y evita las repeticiones degeneradas.

### La temperatura: la perilla creatividad

La temperatura es un parámetro que reescala las probabilidades antes de elegir. Se aplica dividiendo los logits (los puntajes crudos del modelo) por un valor T dentro de la softmax:

```
probabilidad = softmax(logits / T)

T = 0.2  -> distribución afilada: casi siempre el token top. Respuestas seguras.
T = 1.0  -> distribución tal cual la calculó el modelo.
T = 1.5  -> distribución aplanada: más chances a tokens raros. Más creatividad y más error.
```

Con temperatura baja, el modelo se vuelve predecible y conservador. Con temperatura alta, arriesga combinaciones inusuales, y ahí sube tanto la creatividad como la probabilidad de decir cualquier cosa. La misma perilla que te da un poema original te puede dar un dato inventado.

### Por qué inventa: plausibilidad, no verdad

Acá está el núcleo del asunto. El modelo fue entrenado para producir texto probable, texto que suene a como sigue naturalmente lo anterior. La verdad factual es un subproducto, presente cuando los datos de entrenamiento la contenían de forma consistente. Cuando le preguntás algo que el modelo no tiene bien fijado, igual genera la continuación más plausible, porque su tarea es completar. Esa continuación puede ser verosímil y falsa a la vez.

El relevamiento de Ji y colegas (2023) define la alucinación como contenido generado que resulta infiel a la fuente o directamente incorregible con los hechos. El modelo no tiene un detector interno de verdad; tiene un estimador de probabilidad lingüística. Por eso una cita inventada suele tener el formato perfecto de una cita real: el formato es lo que el modelo aprendió a imitar.

### La ventana de contexto y su costo

El modelo solo puede atender a una cantidad limitada de tokens a la vez: su ventana de contexto. Todo lo que entra (tu prompt, los mensajes previos, los documentos que le pegás) compite por ese espacio. Cuando se llena, la información más vieja se recorta y el modelo pierde el hilo del principio de la conversación.

Hay una razón técnica dura para que esa ventana no sea infinita. La autoatención compara cada token con todos los demás, así que su costo crece con el cuadrado de la longitud de la secuencia:

```
costo de atención ≈ n^2

n = 1.000 tokens   ->   1.000.000 de comparaciones
n = 10.000 tokens  ->   100.000.000 de comparaciones
```

Duplicar el contexto cuadruplica el cálculo. Por eso ampliar la ventana es caro y por eso los modelos truncan documentos largos. Cuando la información relevante quedó fuera de la ventana, el modelo responde igual, con lo que recuerda o con lo que inventa.

### Otras causas de error

- Datos de entrenamiento con errores o contradicciones, que el modelo reproduce.

- El corte temporal del conocimiento: cualquier hecho posterior a la fecha de entrenamiento le es desconocido.

- Preguntas muy fuera de lo que vio, donde la predicción se vuelve pura conjetura.

### Cómo se baja el riesgo

Hay palancas concretas. Bajar la temperatura para tareas factuales. Pedirle al modelo que cite y que aclare cuando no está seguro. Mantener la información clave dentro de la ventana de contexto. Y la más efectiva: darle las fuentes reales en el momento de responder, para que genere apoyado en un texto verificable. Esa técnica se llama RAG y es el tema del próximo artículo.

Este artículo sigue a [cómo se entrena un modelo](https://blog.floe.com.ar/como-se-entrena-un-modelo-preentrenamiento-ajuste-fino-y-rlhf/). Para cerrar la serie vemos cómo la IA supera su corte de conocimiento y trabaja con datos frescos en [RAG y herramientas](https://blog.floe.com.ar/rag-y-herramientas-como-la-ia-busca-cita-y-trabaja-con-datos-frescos/).

### Fuentes

- Holtzman et al. (2019), [The Curious Case of Neural Text Degeneration](https://arxiv.org/abs/1904.09751) (nucleus sampling).

- Ji et al. (2023), [Survey of Hallucination in Natural Language Generation](https://arxiv.org/abs/2202.03629), ACM Computing Surveys.
