2024ReviewedOpen access
BadChain: Backdoor Chain-of-Thought Prompting for Large Language Models
Zhen Xiang, Fengqing Jiang, Zidi Xiong, Bhaskar Ramasubramanian, Radha Poovendran, Bo Li
NeurIPS 2024
Abstract
Demonstrates backdoor attacks on chain-of-thought reasoning in LLMs where poisoned demonstrations cause incorrect reasoning chains.
Categories
#chain-of-thought#backdoor#reasoning
Framework mappings
OWASP Top 10 for LLM Applications
- LLM04Data and Model Poisoning
MITRE ATLAS
- AML.T0018Manipulate AI Model
- AML.T0020Poison Training Data
Cite
@inproceedings{xiang2024badchain,
title = {{BadChain: Backdoor Chain-of-Thought Prompting for Large Language Models}},
author = {Zhen Xiang and Fengqing Jiang and Zidi Xiong and Bhaskar Ramasubramanian and Radha Poovendran and Bo Li},
year = {2024},
booktitle = {NeurIPS 2024},
eprint = {2401.12242},
archivePrefix = {arXiv},
url = {https://arxiv.org/abs/2401.12242}
}