August 2026Unreviewed
TRACE: Trajectory Aware Reasoning for Multi-Turn Adversarial Conversation Evaluation
Md Messal Monem Miah, Adrita Anika, Zhiyuan Yu, Ruihong Huang
Abstract
Multi-turn jailbreak attacks have emerged as a critical safety threat to LLMs, as harmful objectives are decomposed across a sequence of apparently benign turns to bypass guardrails. Existing defenses lack the reasoning capacity to identify evolving manipulation patterns, often trading helpfulness for safety by over-refusing benign requests related to sensitive topics. We introduce Trace, a multi-turn defense with trajectory-aware structured reasoning. Before generating each response, the model
Categories
Framework mappings
OWASP Top 10 for LLM Applications
- LLM01Prompt Injection
MITRE ATLAS
- AML.T0054LLM Jailbreak
Suggested from the entry's categories.
Cite
@misc{miah2026trace,
title = {{TRACE: Trajectory Aware Reasoning for Multi-Turn Adversarial Conversation Evaluation}},
author = {Md Messal Monem Miah and Adrita Anika and Zhiyuan Yu and Ruihong Huang},
year = {2026},
month = aug,
eprint = {2608.15594},
archivePrefix = {arXiv},
url = {https://www.semanticscholar.org/paper/e396c538fa9434cc58689737a23e7b0e25ea2ee2}
}