August 2026Unreviewed
Dual-Adversarial Safety Alignment: Cultivating Intrinsic Threat Comprehension in LRMs
Hongli Shen, Shaopeng Fu, Qinbo Zhang, Jian Li, Di Wang
Abstract
Large reasoning models (LRMs) achieve remarkable success on complex tasks but remain vulnerable to harmful prompts that induce unsafe outputs. Recent methods align LRMs using direct refusals or safety rationales, yet often focus on prompt patterns rather than intrinsic attack mechanisms. As a result, these pattern-centric alignments struggle to generalize across diverse jailbreaks, compromising adversarial robustness and reasoning utility. We propose AdvSafe, a dual-adversarial framework that en
Categories
Framework mappings
OWASP Top 10 for LLM Applications
- LLM01Prompt Injection
MITRE ATLAS
- AML.T0054LLM Jailbreak
Suggested from the entry's categories.
Cite
@misc{shen2026dualadversarial,
title = {{Dual-Adversarial Safety Alignment: Cultivating Intrinsic Threat Comprehension in LRMs}},
author = {Hongli Shen and Shaopeng Fu and Qinbo Zhang and Jian Li and Di Wang},
year = {2026},
month = aug,
eprint = {2608.09542},
archivePrefix = {arXiv},
url = {https://arxiv.org/abs/2608.09542}
}