Skip to content
Search
paperSeptember 2026Unreviewed

DIVA: Exploiting Cross-Step Conditional Propagation for Visual Jailbreaks in Discrete Diffusion Vision-Language Models

Guo-Rui Song, Run-Qing Tang, Jing-Ye Zhang, Lu-Yuan Zhang, Fei Huang, Cong Ray, Guo-Cun Wang, Da-Ke Zhong, Choo Sin Wai, Bing-Quan Dai, Chu-Ming Wang, Tongxu Lin, Wan-Yu Guo, Haoqian Wang

Abstract

Large vision-language models (VLMs) are increasingly deployed in safety-critical settings, yet existing visual jailbreak research has focused almost exclusively on autoregressive architectures, leaving an important emerging family unstudied: multimodal discrete diffusion vision-language models (dVLMs). We identify a vulnerability specific to diffusion generation: because the visual embedding conditions every reverse denoising step rather than acting as a one-time prefix, adversarial visual seman

Categories

Framework mappings

MITRE ATLAS
  • AML.T0054LLM Jailbreak

Suggested from the entry's categories.

Cite

@misc{song2026diva,
  title = {{DIVA: Exploiting Cross-Step Conditional Propagation for Visual Jailbreaks in Discrete Diffusion Vision-Language Models}},
  author = {Guo-Rui Song and Run-Qing Tang and Jing-Ye Zhang and Lu-Yuan Zhang and Fei Huang and Cong Ray and Guo-Cun Wang and Da-Ke Zhong and Choo Sin Wai and Bing-Quan Dai and Chu-Ming Wang and Tongxu Lin and Wan-Yu Guo and Haoqian Wang},
  year = {2026},
  month = sep,
  eprint = {2609.05525},
  archivePrefix = {arXiv},
  url = {https://www.semanticscholar.org/paper/75c7781c1563ea318cbc35ebef975200b441c40f}
}