2024ReviewedOpen access
How Johnny Can Persuade LLMs to Jailbreak Them: Rethinking Persuasion to Challenge AI Safety
Yi Zeng, Hongpeng Lin, Jingwen Zhang, Diyi Yang, Ruoxi Jia, Weiyan Shi
ACL 2024
Abstract
Applies social science persuasion techniques to jailbreak LLMs, showing high attack success rates using persuasion taxonomy.
Categories
#persuasion#social-science#human-like
Framework mappings
OWASP Top 10 for LLM Applications
- LLM01Prompt Injection
MITRE ATLAS
- AML.T0054LLM Jailbreak
Cite
@inproceedings{zeng2024how,
title = {{How Johnny Can Persuade LLMs to Jailbreak Them: Rethinking Persuasion to Challenge AI Safety}},
author = {Yi Zeng and Hongpeng Lin and Jingwen Zhang and Diyi Yang and Ruoxi Jia and Weiyan Shi},
year = {2024},
booktitle = {ACL 2024},
eprint = {2401.06373},
archivePrefix = {arXiv},
doi = {10.18653/v1/2024.acl-long.773},
url = {https://arxiv.org/abs/2401.06373}
}