Menos ruido, más voz: Aprendizaje por refuerzo para el razonamiento a través de la purificación de instrucciones

Descubre cómo el aprendizaje por refuerzo optimiza la purificación de instrucciones para potenciar el proceso de aprendizaje de forma efectiva.

sábado, 31 de enero de 2026 • 1 min de lectura • Equipo Q2BSTUDIO

Aprendizaje por refuerzo: purificación de instrucciones

Menos ruido, más voz: Aprendizaje por refuerzo para el razonamiento a través de la purificación de instrucciones ha avanzado en el razonamiento a través de lenguaje y lógica (LLM), pero sigue limitado por una exploración ineficiente bajo presupuestos de rollout limitados, lo que conduce a un bajo éxito en muestreo y a un entrenamiento inestable en tareas complejas. Descubrimos que muchas fallas de exploración no surgen de la dificultad del problema, sino de un pequeño número de tokens de instrucción que introducen interferencia. Basándonos en esta percepción, proponemos el Marco de Muestreo con Menos Ruido (LENS), que primero identifica y elimina los tokens de interferencia para luego transferir rollout exitosos del proceso de purificación para supervisar la optimización de la política en las instrucciones ruidosas originales, permitiendo que el modelo aprenda a ignorar la interferencia en entornos de instrucción ruidosos del mundo real. Los resultados experimentales muestran que LENS supera significativamente a GRPO, ofreciendo un mayor rendimiento y una convergencia más rápida, con una ganancia promedio del 3.88% y más de 1.6 veces la aceleración. Nuestro trabajo destaca el papel crítico de podar los tokens de interferencia en la mejora de la eficiencia del rollout, ofreciendo una nueva perspectiva para la investigación en LLM.

¿UNA PAUSA?

Juega un momento antes de irte

NUESTROS SERVICIOS

Cómo podemos ayudarte

¿Tienes un proyecto en mente?

Cuéntanos tu visión y la convertimos en una solución de software. Sea cual sea el alcance, hacemos realidad tu idea.