Skip to content
Search
paperAugust 2026Unreviewed

TRACE: Trajectory Aware Reasoning for Multi-Turn Adversarial Conversation Evaluation

Md Messal Monem Miah, Adrita Anika, Zhiyuan Yu, Ruihong Huang

Abstract

Multi-turn jailbreak attacks have emerged as a critical safety threat to LLMs, as harmful objectives are decomposed across a sequence of apparently benign turns to bypass guardrails. Existing defenses lack the reasoning capacity to identify evolving manipulation patterns, often trading helpfulness for safety by over-refusing benign requests related to sensitive topics. We introduce Trace, a multi-turn defense with trajectory-aware structured reasoning. Before generating each response, the model

Categories

Framework mappings

MITRE ATLAS
  • AML.T0054LLM Jailbreak

Suggested from the entry's categories.

Cite

@misc{miah2026trace,
  title = {{TRACE: Trajectory Aware Reasoning for Multi-Turn Adversarial Conversation Evaluation}},
  author = {Md Messal Monem Miah and Adrita Anika and Zhiyuan Yu and Ruihong Huang},
  year = {2026},
  month = aug,
  eprint = {2608.15594},
  archivePrefix = {arXiv},
  url = {https://www.semanticscholar.org/paper/e396c538fa9434cc58689737a23e7b0e25ea2ee2}
}