Skip to content
Search
paper2024ReviewedOpen access

Can Sensitive Information Be Deleted From LLMs? Objectives for Defending Against Extraction Attacks

Vaidehi Patil, Peter Hase, Mohit Bansal

ICLR 2024

Abstract

Evaluates methods for deleting sensitive information from trained LLMs, finding current unlearning approaches insufficient against determined adversaries.

Categories

#knowledge-deletion#unlearning#extraction-defense

Framework mappings

OWASP Top 10 for LLM Applications
  • LLM02Sensitive Information Disclosure

Cite

@inproceedings{patil2024can,
  title = {{Can Sensitive Information Be Deleted From LLMs? Objectives for Defending Against Extraction Attacks}},
  author = {Vaidehi Patil and Peter Hase and Mohit Bansal},
  year = {2024},
  booktitle = {ICLR 2024},
  eprint = {2309.17410},
  archivePrefix = {arXiv},
  url = {https://arxiv.org/abs/2309.17410}
}