2024ReviewedOpen access
Can Sensitive Information Be Deleted From LLMs? Objectives for Defending Against Extraction Attacks
Vaidehi Patil, Peter Hase, Mohit Bansal
ICLR 2024
Abstract
Evaluates methods for deleting sensitive information from trained LLMs, finding current unlearning approaches insufficient against determined adversaries.
Categories
#knowledge-deletion#unlearning#extraction-defense
Framework mappings
OWASP Top 10 for LLM Applications
- LLM02Sensitive Information Disclosure
Cite
@inproceedings{patil2024can,
title = {{Can Sensitive Information Be Deleted From LLMs? Objectives for Defending Against Extraction Attacks}},
author = {Vaidehi Patil and Peter Hase and Mohit Bansal},
year = {2024},
booktitle = {ICLR 2024},
eprint = {2309.17410},
archivePrefix = {arXiv},
url = {https://arxiv.org/abs/2309.17410}
}