# Hugging Face — Vision Language Model Alignment in TRL ⚡️

- Company: Hugging Face (huggingface.co)
- Announced: 2025-08-07T00:00:00+00:00
- Category: developer-tool-release
- Subject: Platform
- Models affected: IDEFICS2
- Source: https://huggingface.co/blog/trl-vlm-alignment
- Record: https://forck.live/items/1642-vision-language-model-alignment-in-trl

Hugging Face announces new alignment methods for Vision Language Models in TRL: Mixed Preference Optimization (MPO), Group Relative Policy Optimization (GRPO), Group Sequence Policy Optimization (GSPO), plus extensions for RLOO and Online DPO, and native SFT support for VLMs.

## Evidence

Verbatim from https://huggingface.co/blog/trl-vlm-alignment:

> Here’s what’s new in TRL: Mixed Preference Optimization (MPO) Group Relative Policy Optimization (GRPO) Group Sequence Policy Optimization (GSPO) (a variant of GRPO)

---

Record: https://forck.live/items/1642-vision-language-model-alignment-in-trl
Catalogue: https://forck.live/llms.txt
Feed: https://forck.live/feed.md
