Research
Publications
People
Media
Events
Vacancies
Contact
Paper-Conference
AutoControl Arena: Synthesizing Executable Test Environments for Frontier AI Risk Evaluation
C. Li
,
P. Lu
,
X. Pan
,
F. Barez
,
M. Yang
Interpretability Can Be Actionable
H. Orgad
,
F. Barez
,
T. Haklay
,
I. Lee
,
M. Mosbach
,
A. Reusch
,
N. Saphra
,
Et Al.
Old Habits Die Hard: How Conversational History Geometrically Traps LLMs
A. Simhi
,
F. Barez
,
M. Tutek
,
Y. Belinkov
,
S. B. Cohen
Position: Don't Just "Fix it in Post": A Science of AI Must Study Training Dynamics
S. Biderman
,
M. A. Khan
,
N. Mireshghallah
,
C. Arnett
,
F. Barez
,
N. Saphra
Position: There Are Futures That Benchmark-Driven AI Cannot See
S. Lotfi
,
A. Iranmanesh
,
L. Naghashyar
,
A. Shirali
,
F. Nateghi Haredasht
,
S. Koyejo
,
P. Torr
,
Y. S. Lee
,
F. Barez
,
J. Lehman
,
P. Norvig
,
A. Narayanan
Position: Token Taxes Can Mitigate AI's Economic Risks
L. Irwin
,
T.-Y. Wu
,
F. Barez
Query Circuits: Explaining How Language Models Answer User Prompts
T.-Y. Wu
,
F. Barez
Beyond Linear Probes: Dynamic Safety Monitoring for Language Models
J. Oldfield
,
P. Torr
,
I. Patras
,
A. Bibi
,
F. Barez
Towards Understanding Subliminal Learning: When and How Hidden Biases Transfer
S. Schrodi
,
E. Kempf
,
F. Barez
,
T. Brox
Best-of-N Jailbreaking
J. Hughes
,
S. Price
,
A. Lynch
,
R. Schaeffer
,
F. Barez
,
S. Koyejo
,
H. Sleight
,
E. Jones
,
E. Perez
»
Cite
×