Skip to content
Search
paper2024ReviewedOpen access

How Johnny Can Persuade LLMs to Jailbreak Them: Rethinking Persuasion to Challenge AI Safety

Yi Zeng, Hongpeng Lin, Jingwen Zhang, Diyi Yang, Ruoxi Jia, Weiyan Shi

ACL 2024

Abstract

Applies social science persuasion techniques to jailbreak LLMs, showing high attack success rates using persuasion taxonomy.

Categories

#persuasion#social-science#human-like

Framework mappings

MITRE ATLAS
  • AML.T0054LLM Jailbreak

Cite

@inproceedings{zeng2024how,
  title = {{How Johnny Can Persuade LLMs to Jailbreak Them: Rethinking Persuasion to Challenge AI Safety}},
  author = {Yi Zeng and Hongpeng Lin and Jingwen Zhang and Diyi Yang and Ruoxi Jia and Weiyan Shi},
  year = {2024},
  booktitle = {ACL 2024},
  eprint = {2401.06373},
  archivePrefix = {arXiv},
  doi = {10.18653/v1/2024.acl-long.773},
  url = {https://arxiv.org/abs/2401.06373}
}