Aquesta secció presenta DNO-Prct, una implementació pràctica i escalable d'Optimització Directa Nash. Utilitza aprenentatge contrastiu iteratiu, similar a DPO, però està dissenyat per a entrenament en lots en política amb preferències generals. En utilitzar senyals de recompensa de manera implícita i estructurar comparacions per parells, DNO-Prct permet una auto-millora eficient i s'apropa a l'equilibri de Nash en models de preferències d'IA complexos.





