Lead story
Models & availability
Latest
Lead story
Models & availability
Latest
Qwen3-Omni-Flash-2025-12-01 is an upgraded version of Qwen3-Omni, a native multimodal model that processes text, images, audio, and video, and outputs text and speech simultaneously. This version introduces enhancements in audio-visual interaction, system prompt control, multilingual capabilities, and speech quality.
From the source
Qwen3-Omni is a next-generation native multimodal large model capable of seamlessly processing multiple input modalities—including text, images, audio, and video—and generating both text and natural-sounding speech outputs simultaneously via real-time streaming responses. This version introduces multiple enhancements to improve model performance and efficiency.
qwen.ai