2024ReviewedOpen access
Assessing the Brittleness of Safety Alignment via Pruning and Low-Rank Modifications
Boyi Wei, Kaixuan Huang, Yangsibo Huang, Tinghao Xie, Xiangyu Qi, Mengzhou Xia, Prateek Mittal, Mengdi Wang, Peter Henderson
ICML 2024
Abstract
Demonstrates that safety alignment in LLMs is brittle and can be undermined through simple weight pruning or low-rank modifications without any fine-tuning data.
Categories
#safety-alignment#pruning#brittleness
Framework mappings
OWASP Top 10 for LLM Applications
- LLM04Data and Model Poisoning
MITRE ATLAS
- AML.T0015Evade AI Model
Cite
@inproceedings{wei2024assessing,
title = {{Assessing the Brittleness of Safety Alignment via Pruning and Low-Rank Modifications}},
author = {Boyi Wei and Kaixuan Huang and Yangsibo Huang and Tinghao Xie and Xiangyu Qi and Mengzhou Xia and Prateek Mittal and Mengdi Wang and Peter Henderson},
year = {2024},
booktitle = {ICML 2024},
eprint = {2402.05162},
archivePrefix = {arXiv},
url = {https://arxiv.org/abs/2402.05162}
}