# Atención y Transformers: la arquitectura que hizo posible la IA de hoy

> Si hay un solo invento detrás del salto de la IA moderna, es el Transformer. Apareció en 2017 en un paper con un título que ya es célebre, "Attention Is All You Need", y en pocos años se volvió la base de casi todos los modelos grandes: GPT, Gemini, Claude, LLaMA. Entender el mecanismo de…

- Canonical: [https://blog.floe.com.ar/atencion-y-transformers-la-arquitectura-que-hizo-posible-la-ia-de-hoy/](https://blog.floe.com.ar/atencion-y-transformers-la-arquitectura-que-hizo-posible-la-ia-de-hoy/)

- Author: Juan Cufré

- Published: 2026-07-20T19:00:00+00:00

- Modified: 2026-07-14T19:52:48+00:00

Si hay un solo invento detrás del salto de la IA moderna, es el Transformer. Apareció en 2017 en un paper con un título que ya es célebre, “Attention Is All You Need”, y en pocos años se volvió la base de casi todos los modelos grandes: GPT, Gemini, Claude, LLaMA. Entender el mecanismo de atención es entender por qué la IA de hoy puede manejar contexto largo, correr en paralelo y escalar como escaló. Tercer artículo de la serie IA por dentro, y el más técnico hasta acá.

### El cuello de botella que había antes

Hasta 2017, los mejores modelos de lenguaje usaban redes recurrentes (RNN y su variante LSTM). Estas leen el texto palabra por palabra, en orden, arrastrando un estado interno que resume lo visto. Ese diseño tiene dos costos duros. Uno: el procesamiento es secuencial, así que para leer la palabra mil hay que haber pasado por las 999 anteriores, y eso frena el entrenamiento en hardware paralelo. Dos: la información de las primeras palabras se diluye al llegar lejos, y el modelo pierde dependencias largas.

El Transformer eliminó la recurrencia por completo y la reemplazó por un mecanismo que mira toda la secuencia de una vez: la autoatención.

### La idea de atención, en criollo

La atención deja que cada token mire a todos los demás tokens de la secuencia y decida cuánto le importa cada uno para construir su propio significado. En la frase “el gato que perseguía el perro estaba cansado”, cuando el modelo procesa “cansado”, la atención le permite conectar esa palabra con “gato” (quién estaba cansado) por encima de “perro”. Esa conexión se calcula, no se programa.

### Query, Key y Value: la mecánica dura

Cada token, a partir de su embedding, genera tres vectores mediante matrices aprendidas:

- **Query (consulta):** qué está buscando este token.

- **Key (clave):** qué ofrece este token a los demás.

- **Value (valor):** la información que aporta si resulta relevante.

La relevancia entre dos tokens es el producto punto de la Query de uno con la Key del otro. Esos puntajes se normalizan con una función softmax para que sumen uno, y con esos pesos se hace un promedio ponderado de los Values. La fórmula compacta del paper es esta:

```
Attention(Q, K, V) = softmax( (Q · K^T) / sqrt(d_k) ) · V

Q = matriz de queries
K = matriz de keys
V = matriz de values
d_k = dimensión de las keys (el divisor sqrt(d_k) estabiliza los valores)
```

Leído despacio: cada token arma una consulta, la compara contra las claves de todos los tokens, convierte esas comparaciones en pesos de atención y se queda con una mezcla de los valores de aquellos que le resultaron relevantes. Todo esto son multiplicaciones de matrices, la operación que las GPU hacen a una velocidad brutal y en paralelo. Ahí está la clave del escalado.

### Múltiples cabezas de atención

Una sola operación de atención capta un tipo de relación. El Transformer corre varias en paralelo, las multi-head attention. Cada cabeza aprende a fijarse en algo distinto: una sigue relaciones de sujeto y verbo, otra vínculos de largo alcance, otra concordancia de género. Después se combinan los resultados. Esta multiplicidad es la que le da al modelo una lectura rica y simultánea de la misma frase.

Acá se cierra algo que quedó pendiente en el artículo anterior: por qué “banco” recibe un vector distinto según el contexto. La atención mezcla el embedding de “banco” con el de las palabras que lo rodean, y produce una representación contextual. El mismo token entra igual y sale distinto según la compañía.

### Posición: reponer el orden perdido

Al mirar todos los tokens a la vez, el modelo pierde la noción de orden. “El perro muerde al hombre” y “el hombre muerde al perro” tendrían los mismos tokens. Para arreglarlo, el Transformer suma a cada embedding una codificación posicional: un patrón de números que marca el lugar de cada token en la secuencia. Así la posición vuelve a formar parte del cálculo.

### Apilar capas y por qué eso escaló

Un bloque Transformer combina atención con una pequeña red densa, y el modelo apila decenas o cientos de estos bloques. Cada capa refina la representación de la anterior: las primeras capturan patrones locales de sintaxis, las profundas capturan significado y relaciones abstractas. Los modelos GPT usan solo la mitad decodificadora de la arquitectura original, optimizada para generar texto token a token.

Como todo el cálculo es paralelizable, entrenar un Transformer aprovecha miles de GPU a la vez. Esa propiedad, sumada a más datos y más parámetros, es lo que permitió la carrera de escala de los últimos años. La arquitectura no cambió tanto; lo que creció fue el tamaño. Y con el tamaño llegaron las capacidades emergentes que mencionamos en el primer artículo.

Este artículo sigue a [tokens y embeddings](https://blog.floe.com.ar/tokens-y-embeddings-como-la-ia-convierte-palabras-en-numeros/). Ahora que tenés la arquitectura, el próximo paso es ver cómo se le mete conocimiento y buen comportamiento: [cómo se entrena un modelo, del preentrenamiento al RLHF](https://blog.floe.com.ar/como-se-entrena-un-modelo-preentrenamiento-ajuste-fino-y-rlhf/).

### Fuentes

- Vaswani et al. (2017), [Attention Is All You Need](https://arxiv.org/abs/1706.03762), NeurIPS.

- Bahdanau et al. (2014), [Neural Machine Translation by Jointly Learning to Align and Translate](https://arxiv.org/abs/1409.0473) (origen de la atención).

- Alammar, J., [The Illustrated Transformer](https://jalammar.github.io/illustrated-transformer/) (explicación visual).
