# Amazon — Agent Evaluation Metric for multi-turn conversations

- Company: Amazon (amazon.com)
- Announced: 2026-09-10T15:55:41+00:00
- Category: research-paper
- Coverage: not counted
- Announcement: yes
- Group: announcements
- Source: https://aws.amazon.com/blogs/machine-learning/agent-evaluation-metric-for-multi-turn-conversations/
- Record: https://forck.live/items/9936-agent-evaluation-metric-for-multi-turn-conversations
- Subject: Bedrock / Nova

Amazon introduces the Agent Evaluation Metric (AEM), a decomposable, turn-level metric for measuring agent quality in multi-turn conversations. The first dimension implemented is correctness, which is broken into truthfulness and completeness sub-metrics. AEM is designed to isolate root causes of errors from downstream effects.

## Evidence

Verbatim from https://aws.amazon.com/blogs/machine-learning/agent-evaluation-metric-for-multi-turn-conversations/:

> This post introduces the Agent Evaluation Metric (AEM), a decomposable, turn-level way to measure agent quality.

---

Record: https://forck.live/items/9936-agent-evaluation-metric-for-multi-turn-conversations
Catalogue: https://forck.live/llms.txt
Current issue: https://forck.live/feed.md
