September 2026Unreviewed
Beyond Token Positions: Safety Alignment Across Denoising Steps in Diffusion Language Models
Guoli Wang, Haonan Shi, Tu Ouyang, An Wang
Abstract
Diffusion large language models (dLLMs) generate text through iterative denoising rather than left-to-right decoding. This generation paradigm introduces two axes that can influence safety alignment: when tokens are generated during denoising and where they appear in the response. In this paper, we measure dLLM safety behavior under harmful prompts by tracing intermediate token distributions and commitment decisions throughout denoising. Our analysis shows that refusal signals are concentrated i
Categories
Cite
@misc{wang2026beyond,
title = {{Beyond Token Positions: Safety Alignment Across Denoising Steps in Diffusion Language Models}},
author = {Guoli Wang and Haonan Shi and Tu Ouyang and An Wang},
year = {2026},
month = sep,
eprint = {2609.00495},
archivePrefix = {arXiv},
url = {https://arxiv.org/abs/2609.00495}
}