2023ReviewedOpen access
Shadow Alignment: The Ease of Subverting Safely-Aligned Language Models
Xianjun Yang, Xiao Wang, Qi Zhang, Linda Petzold, William Yang Wang, Xun Zhao, Dahua Lin
arXiv preprint
Abstract
Shows that RLHF can introduce shadow alignment where models exhibit harmful behaviors not present in the base model.
Categories
#RLHF#shadow-alignment#safety-regression
Framework mappings
OWASP Top 10 for LLM Applications
- LLM04Data and Model Poisoning
Cite
@misc{yang2023shadow,
title = {{Shadow Alignment: The Ease of Subverting Safely-Aligned Language Models}},
author = {Xianjun Yang and Xiao Wang and Qi Zhang and Linda Petzold and William Yang Wang and Xun Zhao and Dahua Lin},
year = {2023},
eprint = {2310.02949},
archivePrefix = {arXiv},
url = {https://arxiv.org/abs/2310.02949}
}