Skip to content
Search
paperSeptember 2026Unreviewed

Suan: Rectifying Direct Preference Safety Alignment in Large Language Models

O. Cherednichenko, Roman Klypa

Abstract

Integrating robust safety guardrails into Large Language Models (LLMs) is essential for delivering helpful yet harmless responses. While proprietary systems exhibit reliable safety controls, their underlying methodologies and trade-offs remain largely undisclosed. Achieving comparable security in open-weight models remains a persistent challenge, as post-trained variants frequently suffer from over-refusal and degraded general quality. To overcome these drawbacks, we introduce Suan, a novel pref

Categories

Cite

@misc{cherednichenko2026suan,
  title = {{Suan: Rectifying Direct Preference Safety Alignment in Large Language Models}},
  author = {O. Cherednichenko and Roman Klypa},
  year = {2026},
  month = sep,
  eprint = {2609.08634},
  archivePrefix = {arXiv},
  url = {https://www.semanticscholar.org/paper/98dc74badd21f918c2759ca4f4b2e24562dd61bb}
}