Menos ruido, más voz: Aprendizaje por refuerzo para el razonamiento a través de la purificación de instrucciones

Descubre cómo el aprendizaje por refuerzo optimiza la purificación de instrucciones para potenciar el proceso de aprendizaje de forma efectiva.

sábado, 31 de enero de 2026 • 1 min read • Q2BSTUDIO Team

Aprendizaje por refuerzo: purificación de instrucciones

Menos ruido, más voz: Aprendizaje por refuerzo para el razonamiento a través de la purificación de instrucciones ha avanzado en el razonamiento a través de lenguaje y lógica (LLM), pero sigue limitado por una exploración ineficiente bajo presupuestos de rollout limitados, lo que conduce a un bajo éxito en muestreo y a un entrenamiento inestable en tareas complejas. Descubrimos que muchas fallas de exploración no surgen de la dificultad del problema, sino de un pequeño número de tokens de instrucción que introducen interferencia. Basándonos en esta percepción, proponemos el Marco de Muestreo con Menos Ruido (LENS), que primero identifica y elimina los tokens de interferencia para luego transferir rollout exitosos del proceso de purificación para supervisar la optimización de la política en las instrucciones ruidosas originales, permitiendo que el modelo aprenda a ignorar la interferencia en entornos de instrucción ruidosos del mundo real. Los resultados experimentales muestran que LENS supera significativamente a GRPO, ofreciendo un mayor rendimiento y una convergencia más rápida, con una ganancia promedio del 3.88% y más de 1.6 veces la aceleración. Nuestro trabajo destaca el papel crítico de podar los tokens de interferencia en la mejora de la eficiencia del rollout, ofreciendo una nueva perspectiva para la investigación en LLM.

A BREAK?

Play for a moment before you go

OUR SERVICES

How we can help you

Do you have a project in mind?

Tell us your vision and we'll turn it into a software solution. Whatever the scope, we make your idea real.