Research
Publications
People
Media
Events
Vacancies
Contact
Interpretability
Neuron to Graph: Interpreting Language Model Neurons at Scale
A. Foote*
,
N. Nanda
,
E. Kran
,
I. Konstas
,
S. Cohen
,
F. Barez*
Identifying a Preliminary Circuit for Predicting Gendered Pronouns in GPT-2 Small
C. Mathwin
,
G. Corlouer
,
E. Kran
,
F. Barez
,
N. Nanda
«
Cite
×