Skip to content
Search
paperJune 2026Unreviewed

Detect, Unlearn, Restore: Defending Text Summarization Models Against Data Poisoning

Poojitha Thota, Shirin Nilizadeh

Abstract

Training-time data poisoning during fine-tuning poses a significant threat to large language models (LLMs) deployed for abstractive text summarization, where small task-specific datasets exert disproportionate influence on model behavior. In this setting, adversaries manipulate fine-tuning data to induce persistent summarization failures, such as biased or harmful summaries, while preserving standard evaluation metrics. We present a unified post-hoc defense framework for detecting and remediatin

Categories

Framework mappings

OWASP Top 10 for LLM Applications
  • LLM04Data and Model Poisoning
MITRE ATLAS
  • AML.T0020Poison Training Data

Suggested from the entry's categories.

Cite

@misc{thota2026detect,
  title = {{Detect, Unlearn, Restore: Defending Text Summarization Models Against Data Poisoning}},
  author = {Poojitha Thota and Shirin Nilizadeh},
  year = {2026},
  month = jun,
  eprint = {2606.26036},
  archivePrefix = {arXiv},
  url = {https://arxiv.org/abs/2606.26036}
}