June 2026Unreviewed
Detect, Unlearn, Restore: Defending Text Summarization Models Against Data Poisoning
Poojitha Thota, Shirin Nilizadeh
Abstract
Training-time data poisoning during fine-tuning poses a significant threat to large language models (LLMs) deployed for abstractive text summarization, where small task-specific datasets exert disproportionate influence on model behavior. In this setting, adversaries manipulate fine-tuning data to induce persistent summarization failures, such as biased or harmful summaries, while preserving standard evaluation metrics. We present a unified post-hoc defense framework for detecting and remediatin
Categories
Framework mappings
OWASP Top 10 for LLM Applications
- LLM04Data and Model Poisoning
MITRE ATLAS
- AML.T0020Poison Training Data
Suggested from the entry's categories.
Cite
@misc{thota2026detect,
title = {{Detect, Unlearn, Restore: Defending Text Summarization Models Against Data Poisoning}},
author = {Poojitha Thota and Shirin Nilizadeh},
year = {2026},
month = jun,
eprint = {2606.26036},
archivePrefix = {arXiv},
url = {https://arxiv.org/abs/2606.26036}
}