August 2026Unreviewed
ReFrame: Evidence-Guided Test-Time Safety Alignment in Multimodal Large Language Models
Wenzheng Jiang, Xuan-Kun Rong, Yuan-Zhao Zhai, Da-Wei Feng, Huaimin Wang
Abstract
While multimodal large language models (MLLMs) extend model capabilities beyond text, they also make safety alignment increasingly challenging. Multimodal safety alignment methods must address cross-modal jailbreaks, safety-awareness failures, and over-sensitive refusals. However, existing methods often rely on retraining or internal-state inspection, limiting their applicability to deployed closed-source MLLMs and motivating test-time safety alignment. We analyze this setting and identify two k
Categories
Framework mappings
OWASP Top 10 for LLM Applications
- LLM01Prompt Injection
MITRE ATLAS
- AML.T0054LLM Jailbreak
Suggested from the entry's categories.
Cite
@misc{jiang2026reframe,
title = {{ReFrame: Evidence-Guided Test-Time Safety Alignment in Multimodal Large Language Models}},
author = {Wenzheng Jiang and Xuan-Kun Rong and Yuan-Zhao Zhai and Da-Wei Feng and Huaimin Wang},
year = {2026},
month = aug,
eprint = {2608.21100},
archivePrefix = {arXiv},
url = {https://www.semanticscholar.org/paper/8216bd75e51ed23466c2d4f47ea1dfe2f32e75fd}
}