Skip to content
Search
paperSeptember 2026Unreviewed

Beyond Token Positions: Safety Alignment Across Denoising Steps in Diffusion Language Models

Guoli Wang, Haonan Shi, Tu Ouyang, An Wang

Abstract

Diffusion large language models (dLLMs) generate text through iterative denoising rather than left-to-right decoding. This generation paradigm introduces two axes that can influence safety alignment: when tokens are generated during denoising and where they appear in the response. In this paper, we measure dLLM safety behavior under harmful prompts by tracing intermediate token distributions and commitment decisions throughout denoising. Our analysis shows that refusal signals are concentrated i

Categories

Cite

@misc{wang2026beyond,
  title = {{Beyond Token Positions: Safety Alignment Across Denoising Steps in Diffusion Language Models}},
  author = {Guoli Wang and Haonan Shi and Tu Ouyang and An Wang},
  year = {2026},
  month = sep,
  eprint = {2609.00495},
  archivePrefix = {arXiv},
  url = {https://arxiv.org/abs/2609.00495}
}