# Together AI — Consistency diffusion language models: Up to 14x faster inference without sacrificing quality

- Company: Together AI (together.ai)
- Announced: 2026-02-19T00:00:00+00:00
- Category: research-paper
- Subject: Inference platform
- Models affected: Dream-7B-Instruct, CDLM–Dream
- Source: https://www.together.ai/blog/consistency-diffusion-language-models
- Record: https://forck.live/items/2379-consistency-diffusion-language-models-up-to-14x-faster-inference-without

Together AI introduces consistency diffusion language models (CDLM), a method that accelerates diffusion language model inference by combining consistency-based multi-token finalization with block-wise KV caching, achieving up to 14.5x latency speedups on math and coding tasks.

## Evidence

Verbatim from https://www.together.ai/blog/consistency-diffusion-language-models:

> We introduce consistency diffusion language models (CDLM), which accelerates diffusion language model inference by combining consistency-based multi-token finalization with block-wise KV caching, achieving up to 14.5x latency speedups on math and coding tasks.

---

Record: https://forck.live/items/2379-consistency-diffusion-language-models-up-to-14x-faster-inference-without
Catalogue: https://forck.live/llms.txt
Feed: https://forck.live/feed.md
