September 2026Unreviewed
DIVA: Exploiting Cross-Step Conditional Propagation for Visual Jailbreaks in Discrete Diffusion Vision-Language Models
Guo-Rui Song, Run-Qing Tang, Jing-Ye Zhang, Lu-Yuan Zhang, Fei Huang, Cong Ray, Guo-Cun Wang, Da-Ke Zhong, Choo Sin Wai, Bing-Quan Dai, Chu-Ming Wang, Tongxu Lin, Wan-Yu Guo, Haoqian Wang
Abstract
Large vision-language models (VLMs) are increasingly deployed in safety-critical settings, yet existing visual jailbreak research has focused almost exclusively on autoregressive architectures, leaving an important emerging family unstudied: multimodal discrete diffusion vision-language models (dVLMs). We identify a vulnerability specific to diffusion generation: because the visual embedding conditions every reverse denoising step rather than acting as a one-time prefix, adversarial visual seman
Categories
Framework mappings
OWASP Top 10 for LLM Applications
- LLM01Prompt Injection
MITRE ATLAS
- AML.T0054LLM Jailbreak
Suggested from the entry's categories.
Cite
@misc{song2026diva,
title = {{DIVA: Exploiting Cross-Step Conditional Propagation for Visual Jailbreaks in Discrete Diffusion Vision-Language Models}},
author = {Guo-Rui Song and Run-Qing Tang and Jing-Ye Zhang and Lu-Yuan Zhang and Fei Huang and Cong Ray and Guo-Cun Wang and Da-Ke Zhong and Choo Sin Wai and Bing-Quan Dai and Chu-Ming Wang and Tongxu Lin and Wan-Yu Guo and Haoqian Wang},
year = {2026},
month = sep,
eprint = {2609.05525},
archivePrefix = {arXiv},
url = {https://www.semanticscholar.org/paper/75c7781c1563ea318cbc35ebef975200b441c40f}
}