El artículo de la comunidad de Hugging Face, atribuido a Karina Zadorozhny y publicado el 19 de enero de 2026, analiza cómo se utiliza el aprendizaje por refuerzo para posentrenar grandes modelos de lenguaje. La comparación se centra en REINFORCE, Proximal Policy Optimization (PPO) y Group Relative Policy Optimization (GRPO), tres métodos que no gestionan de la misma manera las recompensas, la estabilidad del entrenamiento ni la infraestructura necesaria.
El aprendizaje empieza con respuestas puntuadas
En el marco descrito por el artículo, el estado st representa el contexto disponible en cada momento: el prompt original del usuario más todos los tokens generados hasta entonces. La acción at es el siguiente token, mientras que la política πθ es el propio LLM, expresado como una distribución de probabilidad sobre su vocabulario y condicionada por ese estado.
La recompensa suele aplicarse a la trayectoria completa, es decir, a la respuesta terminada y no a un token aislado. Para producir esa señal, un modelo de recompensa independiente aprende preferencias humanas u otros criterios y normalmente devuelve una puntuación escalar. En un aprendizaje on-policy, el LLM genera sus propios datos de entrenamiento, esas respuestas reciben una puntuación y los parámetros se actualizan a partir del resultado.
REINFORCE muestra el coste de una señal global
REINFORCE adopta el enfoque más directo de los tres. La actualización asociada a cada token se pondera con la recompensa total obtenida por la trayectoria completa. La relación entre la respuesta final y el ajuste de los parámetros queda así claramente definida.
El problema es que esa sencillez deja al método expuesto a una varianza elevada y a cierta inestabilidad. Una única recompensa para toda la respuesta puede dificultar el control del entrenamiento basado en gradientes de política, porque la señal no distingue con facilidad qué partes de la trayectoria contribuyeron al resultado.
PPO limita el movimiento de la política
El artículo presenta PPO como un método de gradientes de política introducido por OpenAI en 2017. Utiliza Generalized Advantage Estimation para reducir la varianza de las estimaciones del gradiente y mantener un sesgo bajo. También depende de un crítico, o función de valor, que estima el valor de un estado.
Para evitar cambios demasiado bruscos, PPO restringe las actualizaciones mediante clipping o mediante una penalización adaptativa basada en la divergencia KL. En PPO-CLIP, el valor habitual de ε es 0,2, lo que mantiene la ratio de probabilidades entre 0,8 y 1,2. El límite reduce cuánto puede desplazarse la política en una actualización.
Ese control tiene una consecuencia operativa. Durante el entrenamiento pueden tener que cargarse al mismo tiempo la política, un modelo de referencia, un crítico grande y, a menudo, un modelo de recompensa. PPO aporta mecanismos adicionales para gestionar la varianza y restringir los cambios de política, pero sus modelos auxiliares aumentan las necesidades de memoria.
GRPO reemplaza el crítico por una comparación
GRPO prescinde de un crítico independiente y utiliza como referencia la puntuación media de un grupo de respuestas. El artículo señala que un grupo suele contener 64 muestras. Para cada respuesta, el método resta la puntuación media del grupo y divide el resultado por su desviación estándar para calcular la ventaja.
La función de pérdida incorpora además una penalización KL entre la política actual y un modelo de referencia congelado. Esta restricción limita la desviación respecto al modelo de referencia, aunque el artículo la distingue de la penalización KL de región de confianza descrita para PPO. GRPO elimina el crítico, pero sigue dependiendo de una referencia congelada y de la generación y comparación de varias respuestas.
El artículo identifica DeepSeek-R1 y DeepSeek-V3 como modelos que utilizan este enfoque sin crítico. El ejemplo coloca a GRPO en el debate sobre métodos que buscan reducir la infraestructura asociada a PPO, sin presentar los dos enfoques como equivalentes en su funcionamiento.
La diferencia afecta al diseño del entrenamiento
La comparación deja claro que «aprendizaje por refuerzo» no designa una receta única para el posentrenamiento de LLM. REINFORCE utiliza directamente la recompensa de la trayectoria y queda más expuesto a la varianza. PPO añade un crítico y controles específicos sobre las actualizaciones. GRPO obtiene la referencia a partir de un grupo de respuestas, elimina el crítico y mantiene una restricción KL frente a un modelo congelado.
Para quienes intentan interpretar la terminología del entrenamiento de modelos, la distinción es práctica: la forma de calcular la recompensa, el tipo de referencia y la protección frente a la desviación de la política determinan cómo aprende el sistema a partir de respuestas evaluadas. También influyen en la cantidad de modelos auxiliares y de respuestas que deben gestionarse durante el proceso.
El artículo de Karina Zadorozhny no trata REINFORCE, PPO y GRPO como etiquetas intercambiables. Su conclusión es más concreta: elegir un algoritmo de posentrenamiento implica decidir cómo se transforma una evaluación de las respuestas en actualizaciones del LLM y qué coste operativo acompaña a ese aprendizaje.
