Skip to content
Search
paperAugust 2026Unreviewed

ReFrame: Evidence-Guided Test-Time Safety Alignment in Multimodal Large Language Models

Wenzheng Jiang, Xuan-Kun Rong, Yuan-Zhao Zhai, Da-Wei Feng, Huaimin Wang

Abstract

While multimodal large language models (MLLMs) extend model capabilities beyond text, they also make safety alignment increasingly challenging. Multimodal safety alignment methods must address cross-modal jailbreaks, safety-awareness failures, and over-sensitive refusals. However, existing methods often rely on retraining or internal-state inspection, limiting their applicability to deployed closed-source MLLMs and motivating test-time safety alignment. We analyze this setting and identify two k

Categories

Framework mappings

MITRE ATLAS
  • AML.T0054LLM Jailbreak

Suggested from the entry's categories.

Cite

@misc{jiang2026reframe,
  title = {{ReFrame: Evidence-Guided Test-Time Safety Alignment in Multimodal Large Language Models}},
  author = {Wenzheng Jiang and Xuan-Kun Rong and Yuan-Zhao Zhai and Da-Wei Feng and Huaimin Wang},
  year = {2026},
  month = aug,
  eprint = {2608.21100},
  archivePrefix = {arXiv},
  url = {https://www.semanticscholar.org/paper/8216bd75e51ed23466c2d4f47ea1dfe2f32e75fd}
}