# OpenAI — How confessions can keep language models honest

- Company: OpenAI (openai.com)
- Announced: 2025-12-03T10:00:00+00:00
- Category: research-paper
- Subject: GPT / ChatGPT / API
- Source: https://openai.com/index/how-confessions-can-keep-language-models-honest
- Record: https://forck.live/items/357-how-confessions-can-keep-language-models-honest

OpenAI researchers are testing a method called 'confessions' that trains models to admit when they make mistakes or act undesirably, aiming to improve AI honesty, transparency, and trust.

## Evidence

Verbatim from https://openai.com/index/how-confessions-can-keep-language-models-honest:

> OpenAI researchers are testing “confessions,” a method that trains models to admit when they make mistakes or act undesirably, helping improve AI honesty, transparency, and trust in model outputs.

---

Record: https://forck.live/items/357-how-confessions-can-keep-language-models-honest
Catalogue: https://forck.live/llms.txt
Feed: https://forck.live/feed.md
