Un Transformer recién armado es una hoja en blanco con miles de millones de parámetros puestos al azar. No sabe español, no conoce ningún hecho, no sigue instrucciones. Todo lo que después parece inteligencia entra durante el entrenamiento, que hoy se hace en tres etapas bien distintas. Entenderlas explica por qué un modelo sabe tanto, por qué responde con cierto tono y por qué a veces repite los sesgos de internet. Cuarto artículo de la serie IA por dentro.
Etapa uno: el preentrenamiento
La primera fase es la más pesada y la que le da al modelo su conocimiento del mundo. El objetivo es el que ya conocés de esta serie: predecir el próximo token. Se le muestra al modelo un océano de texto (páginas web, libros, código, artículos) y en cada paso se le tapa lo que sigue y se lo obliga a adivinarlo.
Esto se llama aprendizaje autosupervisado, porque las etiquetas salen del propio texto sin que ningún humano las escriba. El mecanismo matemático es este:
- El modelo predice una distribución de probabilidad para el próximo token.
- Se compara con el token real usando una función de pérdida (cross-entropy).
- La retropropagación calcula cuánto contribuyó cada parámetro al error.
- El descenso por gradiente ajusta cada parámetro un poquito en la dirección que baja el error.
Repetido billones de veces, ese ajuste minúsculo va tallando la red hasta que predice bien. Este proceso corre durante semanas o meses en miles de GPU y es la parte más cara, con costos que llegan a millones de dólares. El resultado es el modelo base o foundation model.
Cuánto ayuda la escala
Dos trabajos marcaron el rumbo. Las leyes de escala de Kaplan y colegas (2020) mostraron que el rendimiento mejora de forma predecible al aumentar parámetros, datos y cómputo juntos. Después, el estudio Chinchilla de DeepMind (2022) afinó la receta: para un presupuesto de cómputo dado, conviene equilibrar el tamaño del modelo con la cantidad de datos, porque muchos modelos grandes estaban entrenados con pocos datos para su tamaño.
De esas curvas sale una consecuencia importante: el conocimiento del modelo queda congelado en la fecha de corte de sus datos de entrenamiento. Un modelo entrenado hasta cierto mes desconoce lo que pasó después. Esa limitación es la que después empuja hacia la búsqueda y las herramientas externas, tema del último artículo de la serie.
El modelo base completa, todavía no obedece
Un modelo recién preentrenado es un completador de texto potentísimo con un problema práctico: si le escribís una pregunta, puede seguirla con otra pregunta, porque en internet las preguntas suelen venir en listas. Sabe muchísimo y obedece poco. Para volverlo un asistente hacen falta las dos etapas siguientes.
Etapa dos: ajuste fino supervisado
En el ajuste fino supervisado (SFT), se sigue entrenando el modelo con un conjunto mucho más chico y cuidado: miles de ejemplos de instrucción y respuesta ideal, escritos o curados por personas. Cada ejemplo le enseña el formato de “alguien pide algo, yo respondo de forma útil”. El modelo conserva todo su conocimiento previo y aprende encima el hábito de responder instrucciones.
Etapa tres: RLHF, aprender de la preferencia humana
La tercera etapa es la que convirtió a estos modelos en algo usable por cualquiera. Se llama aprendizaje por refuerzo con retroalimentación humana (RLHF) y fue el corazón del trabajo InstructGPT de OpenAI (Ouyang y colegas, 2022). Va así:
- El modelo genera varias respuestas para un mismo pedido.
- Personas las ordenan de mejor a peor según utilidad, veracidad y seguridad.
- Con esas comparaciones se entrena un modelo de recompensa que aprende a puntuar respuestas como lo haría un humano.
- Un algoritmo de refuerzo (típicamente PPO) ajusta el modelo para maximizar esa recompensa.
El resultado es un modelo que tiende a dar respuestas útiles, con tono cordial y con ciertos límites de seguridad. Buena parte de la personalidad de un asistente (que se disculpe, que estructure, que evite contenido peligroso) se moldea en esta fase. InstructGPT mostró que un modelo mucho más chico alineado con RLHF era preferido por los usuarios frente a uno gigante sin alinear.
Qué se hereda de todo esto
Este pipeline explica varios comportamientos observables:
- El conocimiento y también los sesgos vienen del corpus de preentrenamiento. Si internet tiene un prejuicio, el modelo lo absorbe.
- El tono y los rechazos vienen del RLHF y reflejan las preferencias de quienes etiquetaron.
- El corte temporal del conocimiento viene de la fecha de los datos, y crea la necesidad de conectar el modelo a fuentes frescas.
Este artículo sigue a atención y Transformers. Con el entrenamiento en la cabeza, ya podemos encarar una de las preguntas más frecuentes sobre la IA: por qué la IA alucina.
Fuentes
- Ouyang et al. (2022), Training language models to follow instructions with human feedback (InstructGPT).
- Kaplan et al. (2020), Scaling Laws for Neural Language Models.
- Hoffmann et al. (2022), Training Compute-Optimal Large Language Models (Chinchilla).