Skip to content
Search
paperAugust 2026Unreviewed

Dual-Adversarial Safety Alignment: Cultivating Intrinsic Threat Comprehension in LRMs

Hongli Shen, Shaopeng Fu, Qinbo Zhang, Jian Li, Di Wang

Abstract

Large reasoning models (LRMs) achieve remarkable success on complex tasks but remain vulnerable to harmful prompts that induce unsafe outputs. Recent methods align LRMs using direct refusals or safety rationales, yet often focus on prompt patterns rather than intrinsic attack mechanisms. As a result, these pattern-centric alignments struggle to generalize across diverse jailbreaks, compromising adversarial robustness and reasoning utility. We propose AdvSafe, a dual-adversarial framework that en

Categories

Framework mappings

MITRE ATLAS
  • AML.T0054LLM Jailbreak

Suggested from the entry's categories.

Cite

@misc{shen2026dualadversarial,
  title = {{Dual-Adversarial Safety Alignment: Cultivating Intrinsic Threat Comprehension in LRMs}},
  author = {Hongli Shen and Shaopeng Fu and Qinbo Zhang and Jian Li and Di Wang},
  year = {2026},
  month = aug,
  eprint = {2608.09542},
  archivePrefix = {arXiv},
  url = {https://arxiv.org/abs/2608.09542}
}