Lead story
Models & availability
Latest
Lead story
Models & availability
Latest
Hugging Face announces new alignment methods for Vision Language Models in TRL: Mixed Preference Optimization (MPO), Group Relative Policy Optimization (GRPO), Group Sequence Policy Optimization (GSPO), plus extensions for RLOO and Online DPO, and native SFT support for VLMs.
From the source
Here’s what’s new in TRL: Mixed Preference Optimization (MPO) Group Relative Policy Optimization (GRPO) Group Sequence Policy Optimization (GSPO) (a variant of GRPO)
huggingface.co