← Back to search
paper llmsec-2026-00090
Latent Adversarial Detection: Adaptive Probing of LLM Activations for Multi-Turn Attack Detection
Prashant Kulkarni
2026-04
Abstract
Multi-turn prompt injection follows a known attack path -- trust-building, pivoting, escalation but text-level defenses miss covert attacks where individual turns appear benign. We show this attack path leaves an activation-level signature in the model's residual stream: each phase shift moves the activation, producing a total path length far exceeding benign conversations. We call this adversarial restlessness. Five scalar trajectory features capturing this signal lift conversation-level detect
Categories
Cite This Resource
@article{llmsec202600090,
title = {Latent Adversarial Detection: Adaptive Probing of LLM Activations for Multi-Turn Attack Detection},
author = {Prashant Kulkarni},
year = {2026},
url = {https://arxiv.org/abs/2604.28129},
} Metadata
- Added
- 2026-05-17
- Added by
- automation
- Source
- arxiv
- arxiv_id
- 2604.28129