# OpenAI — Language models can explain neurons in language models

- Company: OpenAI (openai.com)
- Announced: 2023-05-09T07:00:00+00:00
- Category: research-paper
- Coverage: not counted
- Announcement: yes
- Group: announcements
- Source: https://openai.com/index/language-models-can-explain-neurons-in-language-models
- Record: https://forck.live/items/862-language-models-can-explain-neurons-in-language-models
- Subject: GPT / ChatGPT / API
- Models affected: GPT-2

OpenAI uses GPT-4 to automatically write and score explanations for neurons in GPT-2, and releases a dataset of these explanations and scores for every neuron in GPT-2.

## Evidence

Verbatim from https://openai.com/index/language-models-can-explain-neurons-in-language-models:

> We use GPT-4 to automatically write explanations for the behavior of neurons in large language models and to score those explanations. We release a dataset of these (imperfect) explanations and scores for every neuron in GPT-2.

---

Record: https://forck.live/items/862-language-models-can-explain-neurons-in-language-models
Catalogue: https://forck.live/llms.txt
Current issue: https://forck.live/feed.md
