Research
Publications
People
Media
Events
Vacancies
Contact
ICLR
Beyond Linear Probes: Dynamic Safety Monitoring for Language Models
J. Oldfield
,
P. Torr
,
I. Patras
,
A. Bibi
,
F. Barez
Towards Understanding Subliminal Learning: When and How Hidden Biases Transfer
S. Schrodi
,
E. Kempf
,
F. Barez
,
T. Brox
Rethinking AI Cultural Alignment
M. Bravansky
,
F. Trhlík
,
F. Barez
Towards Interpreting Visual Information Processing in Vision-Language Models
C. Neo
,
L. Ong
,
P. Torr
,
M. Geva
,
D. Krueger
,
F. Barez
Understanding Addition in Transformers
P. Quirke
,
F. Barez
Neuron to Graph: Interpreting Language Model Neurons at Scale
A. Foote*
,
N. Nanda
,
E. Kran
,
I. Konstas
,
S. Cohen
,
F. Barez*
Cite
×