# Amazon — Reduce RAG costs on Amazon Bedrock with query-aware compression

- Company: Amazon (amazon.com)
- Announced: 2026-08-21T16:59:15+00:00
- Category: capability-change
- Subject: Bedrock / Nova
- Models affected: Anthropic Claude Haiku, Anthropic Claude Sonnet
- Source: https://aws.amazon.com/blogs/machine-learning/reduce-rag-costs-on-amazon-bedrock-with-query-aware-compression/
- Record: https://forck.live/items/4315-reduce-rag-costs-on-amazon-bedrock-with-query-aware-compression

Amazon Bedrock introduces a query-aware compression pattern for RAG: a smaller, lower-cost model filters retrieved chunks against the user's query before the primary model generates the answer, reducing input tokens and costs while preserving answer quality.

## Evidence

Verbatim from https://aws.amazon.com/blogs/machine-learning/reduce-rag-costs-on-amazon-bedrock-with-query-aware-compression/:

> After retrieval but before the final answer call, a smaller, lower-cost model on Amazon Bedrock filters retrieved chunks against the user’s query.

---

Record: https://forck.live/items/4315-reduce-rag-costs-on-amazon-bedrock-with-query-aware-compression
Catalogue: https://forck.live/llms.txt
Feed: https://forck.live/feed.md
