Skip to content
Search
paper2024ReviewedOpen access

BadChain: Backdoor Chain-of-Thought Prompting for Large Language Models

Zhen Xiang, Fengqing Jiang, Zidi Xiong, Bhaskar Ramasubramanian, Radha Poovendran, Bo Li

NeurIPS 2024

Abstract

Demonstrates backdoor attacks on chain-of-thought reasoning in LLMs where poisoned demonstrations cause incorrect reasoning chains.

Categories

#chain-of-thought#backdoor#reasoning

Framework mappings

OWASP Top 10 for LLM Applications
  • LLM04Data and Model Poisoning
MITRE ATLAS
  • AML.T0018Manipulate AI Model
  • AML.T0020Poison Training Data

Cite

@inproceedings{xiang2024badchain,
  title = {{BadChain: Backdoor Chain-of-Thought Prompting for Large Language Models}},
  author = {Zhen Xiang and Fengqing Jiang and Zidi Xiong and Bhaskar Ramasubramanian and Radha Poovendran and Bo Li},
  year = {2024},
  booktitle = {NeurIPS 2024},
  eprint = {2401.12242},
  archivePrefix = {arXiv},
  url = {https://arxiv.org/abs/2401.12242}
}