En el campo de la inteligencia artificial, el Aprendizaje por Refuerzo (RL) ha permitido a los Modelos de Lenguaje de Gran Escala (LLMs) adquirir capacidades de razonamiento cada vez más complejas y comportamientos agentivos. En un nuevo trabajo, se proponen dos técnicas simples para mejorar los algoritmos de gradiente de política para LLMs.
En primer lugar, se sugiere reemplazar la política de anclaje fija durante el RL por un Promedio Móvil Exponencial (EMA), similar a una red objetivo en el aprendizaje profundo Q. En segundo lugar, se introduce el estimador Top-k KL, que permite una interpolación flexible entre KL exactos y KL muestreados.
Estas técnicas, conocidas como EMA-PG, han demostrado ser efectivas al combinarse con GRPO, lo que ha llevado a mejoras significativas en el rendimiento. Por ejemplo, en el razonamiento matemático, estas técnicas permiten a R1-Qwen-1.5B alcanzar un 53.9% en OlympiadBench, en comparación con el 50.8% obtenido por GRPO.
En escenarios de RL agentivos, con una base de Qwen-3B, EMA-PG mejora GRPO en un promedio del 33.3% en 7 conjuntos de datos de preguntas y respuestas con motores de búsqueda. Estas mejoras incluyen un aumento del 29.7% al 44.1% en HotpotQA, y del 27.4% al 40.1% en 2WikiMultiHopQA.
En conclusión, EMA-PG se presenta como un enfoque sencillo, basado en principios sólidos y potente para escalar el RL en LLMs. En Q2BSTUDIO, empresa especializada en el desarrollo de software a medida, aplicaciones personalizadas e inteligencia artificial para empresas, entendemos la importancia de implementar innovaciones como EMA-PG para optimizar el rendimiento y la eficiencia de nuestros productos. Contáctanos para descubrir cómo podemos ayudarte a aprovechar al máximo las tecnologías emergentes y llevar tu negocio al siguiente nivel.
Para más información sobre nuestros servicios de desarrollo de aplicaciones a medida, visita Q2BSTUDIO - Desarrollo de Aplicaciones a Medida.





