Skip to content
Search
paper2024ReviewedOpen access

Visual Adversarial Examples Jailbreak Aligned Large Language Models

Xiangyu Qi, Kaixuan Huang, Ashwinee Panda, Peter Henderson, Mengdi Wang, Prateek Mittal

AAAI 2024

Abstract

Shows adversarial images can jailbreak multimodal LLMs that are robust to text-only attacks, bypassing alignment through the visual channel.

Categories

#visual#multimodal#image-jailbreak

Framework mappings

MITRE ATLAS
  • AML.T0043Craft Adversarial Data

Cite

@inproceedings{qi2024visual,
  title = {{Visual Adversarial Examples Jailbreak Aligned Large Language Models}},
  author = {Xiangyu Qi and Kaixuan Huang and Ashwinee Panda and Peter Henderson and Mengdi Wang and Prateek Mittal},
  year = {2024},
  booktitle = {AAAI 2024},
  eprint = {2306.13213},
  archivePrefix = {arXiv},
  doi = {10.1609/aaai.v38i19.30150},
  url = {https://arxiv.org/abs/2306.13213}
}