September 2026Unreviewed
Suan: Rectifying Direct Preference Safety Alignment in Large Language Models
O. Cherednichenko, Roman Klypa
Abstract
Integrating robust safety guardrails into Large Language Models (LLMs) is essential for delivering helpful yet harmless responses. While proprietary systems exhibit reliable safety controls, their underlying methodologies and trade-offs remain largely undisclosed. Achieving comparable security in open-weight models remains a persistent challenge, as post-trained variants frequently suffer from over-refusal and degraded general quality. To overcome these drawbacks, we introduce Suan, a novel pref
Categories
Cite
@misc{cherednichenko2026suan,
title = {{Suan: Rectifying Direct Preference Safety Alignment in Large Language Models}},
author = {O. Cherednichenko and Roman Klypa},
year = {2026},
month = sep,
eprint = {2609.08634},
archivePrefix = {arXiv},
url = {https://www.semanticscholar.org/paper/98dc74badd21f918c2759ca4f4b2e24562dd61bb}
}