Research
Publications
People
Media
Events
Vacancies
Contact
Article
The Singapore Consensus on Global AI Safety Research Priorities
Y. Bengio
,
T. Maharaj
,
L. Ong
,
S. Russell
,
D. Song
,
M. Tegmark
,
L. Xue
,
F. Barez
,
Et Al.
SafetyNet: Detecting Harmful Outputs in LLMs by Modeling and Monitoring Deceptive Behaviors
M. Chaudhary
,
F. Barez
AILuminate: Introducing v1.0 of the AI Risk and Reliability Benchmark from MLCommons
S. Ghosh
,
H. Frase
,
A. Williams
,
S. Luger
,
P. Röttger
,
F. Barez
,
S. McGregor
,
Et Al.
Chain-of-Thought Is Not Explainability
F. Barez
,
T.-Y. Wu
,
I. Arcuschin
,
M. Lan
,
V. Wang
,
N. Siegel
,
N. Collignon
,
C. Neo
,
I. Lee
,
A. Paren
,
A. Bibi
,
R. Trager
,
D. Fornasiere
,
J. Yan
,
Y. Elazar
,
Y. Bengio
Open Problems in Machine Unlearning for AI Safety
F. Barez
,
T. Fu
,
A. Prabhu
,
S. Casper
,
A. Sanyal
,
A. Bibi
,
A. O'Gara
,
R. Kirk
,
B. Bucknall
,
T. Fist
,
L. Ong
,
P. Torr
,
K.-Y. Lam
,
R. Trager
,
D. Krueger
,
S. Mindermann
,
J. Hernández-Orallo
,
M. Geva
,
Y. Gal
Plan B: Training LLMs to Fail Less Severely
J. Stastny
,
N. Warncke
,
D. Xu
,
A. Lynch
,
F. Barez
,
H. Sleight
,
E. Perez
Safety Frameworks and Standards: A Comparative Analysis to Advance Risk Management of Frontier AI
M. Ziosi
,
J. Gealy
,
M. Plueckebaum
,
D. Kossack
,
S. Campos
,
L. Saouma
,
F. Barez
,
Et Al.
Toward Resisting AI-Enabled Authoritarianism
F. Barez
,
I. Friend
,
K. Reid
,
I. Krawczuk
,
V. Wang
,
J. Mökander
,
P. Torr
,
J. Morse
,
R. Trager
Verification for International AI Governance
B. Harack
,
R. Trager
,
A. Reuel
,
D. Manheim
,
M. Brundage
,
O. Aarne
,
Et Al.
Jailbreak Defense in a Narrow Domain: Limitations of Existing Methods and a New Transcript-Classifier Approach
T. T. Wang
,
J. Hughes
,
H. Sleight
,
R. Schaeffer
,
R. Agrawal
,
F. Barez
,
Et Al.
«
»
Cite
×