Lead story
Models & availability
Latest
Lead story
Models & availability
Latest
Alibaba proposes the Group Sequence Policy Optimization (GSPO) algorithm to address instability and model collapse issues in existing reinforcement learning algorithms for language models, aiming to enable scalable RL training.
From the source
To enable successful RL scaling, we propose the Group Sequence Policy Optimization (GSPO) algorithm.
qwenlm.github.io