2024ReviewedOpen access
Visual Adversarial Examples Jailbreak Aligned Large Language Models
Xiangyu Qi, Kaixuan Huang, Ashwinee Panda, Peter Henderson, Mengdi Wang, Prateek Mittal
AAAI 2024
Abstract
Shows adversarial images can jailbreak multimodal LLMs that are robust to text-only attacks, bypassing alignment through the visual channel.
Categories
#visual#multimodal#image-jailbreak
Framework mappings
OWASP Top 10 for LLM Applications
- LLM01Prompt Injection
MITRE ATLAS
- AML.T0043Craft Adversarial Data
Cite
@inproceedings{qi2024visual,
title = {{Visual Adversarial Examples Jailbreak Aligned Large Language Models}},
author = {Xiangyu Qi and Kaixuan Huang and Ashwinee Panda and Peter Henderson and Mengdi Wang and Prateek Mittal},
year = {2024},
booktitle = {AAAI 2024},
eprint = {2306.13213},
archivePrefix = {arXiv},
doi = {10.1609/aaai.v38i19.30150},
url = {https://arxiv.org/abs/2306.13213}
}