Lead story
Models & availability
Latest
Lead story
Models & availability
Latest
Artificial Analysis releases Big Bench Audio, a new evaluation dataset for assessing audio reasoning, and presents benchmark results for GPT-4o and Gemini 1.5 series models across speech and text modalities, revealing a significant speech reasoning gap.
From the source
Artificial Analysis is releasing Big Bench Audio, a new evaluation dataset for assessing the reasoning capabilities of audio language models.
huggingface.co