Skip to content
Search
paper2023ReviewedOpen access

Shadow Alignment: The Ease of Subverting Safely-Aligned Language Models

Xianjun Yang, Xiao Wang, Qi Zhang, Linda Petzold, William Yang Wang, Xun Zhao, Dahua Lin

arXiv preprint

Abstract

Shows that RLHF can introduce shadow alignment where models exhibit harmful behaviors not present in the base model.

Categories

#RLHF#shadow-alignment#safety-regression

Framework mappings

OWASP Top 10 for LLM Applications
  • LLM04Data and Model Poisoning

Cite

@misc{yang2023shadow,
  title = {{Shadow Alignment: The Ease of Subverting Safely-Aligned Language Models}},
  author = {Xianjun Yang and Xiao Wang and Qi Zhang and Linda Petzold and William Yang Wang and Xun Zhao and Dahua Lin},
  year = {2023},
  eprint = {2310.02949},
  archivePrefix = {arXiv},
  url = {https://arxiv.org/abs/2310.02949}
}