# Together AI — Introducing AutoJudge: Streamlined inference acceleration via automated dataset curation

- Company: Together AI (together.ai)
- Announced: 2025-12-03T00:00:00+00:00
- Category: research-paper
- Subject: Inference platform
- Models affected: Llama-3.2 1B, Llama-3.1 8B, Llama-3.1 70B, Llama-3.1-405B
- Source: https://www.together.ai/blog/introducing-autojudge-streamlined-inference-acceleration-via-automated-dataset-curation
- Record: https://forck.live/items/2398-introducing-autojudge-streamlined-inference-acceleration-via-automated-dataset

Together AI introduces AutoJudge, a research method that accelerates LLM inference through task-specific lossy speculative decoding, which automatically identifies which generated tokens affect downstream quality without manual annotation. It achieves 1.5–2x speedups over standard speculative decoding by accepting up to 40 draft tokens per verification cycle with slight accuracy drop, and will be presented at NeurIPS 2025.

## Evidence

Verbatim from https://www.together.ai/blog/introducing-autojudge-streamlined-inference-acceleration-via-automated-dataset-curation:

> We introduce AutoJudge, a method that accelerates large language model (LLM) inference through task-specific lossy speculative decoding.

---

Record: https://forck.live/items/2398-introducing-autojudge-streamlined-inference-acceleration-via-automated-dataset
Catalogue: https://forck.live/llms.txt
Feed: https://forck.live/feed.md
