Research
Publications
People
Media
Events
Vacancies
Contact
ICML
AutoControl Arena: Synthesizing Executable Test Environments for Frontier AI Risk Evaluation
C. Li
,
P. Lu
,
X. Pan
,
F. Barez
,
M. Yang
Interpretability Can Be Actionable
H. Orgad
,
F. Barez
,
T. Haklay
,
I. Lee
,
M. Mosbach
,
A. Reusch
,
N. Saphra
,
Et Al.
Old Habits Die Hard: How Conversational History Geometrically Traps LLMs
A. Simhi
,
F. Barez
,
M. Tutek
,
Y. Belinkov
,
S. B. Cohen
Position: Don't Just "Fix it in Post": A Science of AI Must Study Training Dynamics
S. Biderman
,
M. A. Khan
,
N. Mireshghallah
,
C. Arnett
,
F. Barez
,
N. Saphra
Position: There Are Futures That Benchmark-Driven AI Cannot See
S. Lotfi
,
A. Iranmanesh
,
L. Naghashyar
,
A. Shirali
,
F. Nateghi Haredasht
,
S. Koyejo
,
P. Torr
,
Y. S. Lee
,
F. Barez
,
J. Lehman
,
P. Norvig
,
A. Narayanan
Position: Token Taxes Can Mitigate AI's Economic Risks
L. Irwin
,
T.-Y. Wu
,
F. Barez
Query Circuits: Explaining How Language Models Answer User Prompts
T.-Y. Wu
,
F. Barez
Do Sparse Autoencoders Generalize? A Case Study of Answerability
L. Heindrich
,
P. Torr
,
F. Barez
,
V. Thost
PoisonBench: Assessing Large Language Model Vulnerability to Data Poisoning
T. Fu*
,
M. Sharma
,
P. Torr
,
S. B. Cohen
,
D. Krueger
,
F. Barez*
Scaling Sparse Feature Circuit Finding for In-Context Learning
D. Kharlapenko
,
S. Shabalin
,
F. Barez
,
A. Conmy
,
N. Nanda
»
Cite
×