Skip to content
Search
paperJuly 2026Unreviewed

JailMeter: An Evidence-Based Evaluation Framework for Jailbreak Attacks on Large Language Models

Qingjia Huang, Jingyu Zhang, Jianguo Wu, Yakai Li, Weijuan Zhang, Yankai Rong, Junyi Yao, Shengzhi Zhang, Xiaoqi Jia

Abstract

The assessment of jailbreak attacks against large language models currently suffers from inconsistent evaluation criteria and methods, leading to unreliable estimates of attack success rates. We propose JailMeter, an evidence-based evaluation framework designed to more faithfully measure jailbreak effectiveness. Inspired by the Information Bottleneck theory, JailMeter applies dual-feedback optimization to filter jailbreak noise from model responses while preserving content relevant to the origin

Categories

Framework mappings

MITRE ATLAS
  • AML.T0054LLM Jailbreak

Suggested from the entry's categories.

Cite

@misc{huang2026jailmeter,
  title = {{JailMeter: An Evidence-Based Evaluation Framework for Jailbreak Attacks on Large Language Models}},
  author = {Qingjia Huang and Jingyu Zhang and Jianguo Wu and Yakai Li and Weijuan Zhang and Yankai Rong and Junyi Yao and Shengzhi Zhang and Xiaoqi Jia},
  year = {2026},
  month = jul,
  eprint = {2607.19424},
  archivePrefix = {arXiv},
  url = {https://arxiv.org/abs/2607.19424}
}