July 2026Unreviewed
JailMeter: An Evidence-Based Evaluation Framework for Jailbreak Attacks on Large Language Models
Qingjia Huang, Jingyu Zhang, Jianguo Wu, Yakai Li, Weijuan Zhang, Yankai Rong, Junyi Yao, Shengzhi Zhang, Xiaoqi Jia
Abstract
The assessment of jailbreak attacks against large language models currently suffers from inconsistent evaluation criteria and methods, leading to unreliable estimates of attack success rates. We propose JailMeter, an evidence-based evaluation framework designed to more faithfully measure jailbreak effectiveness. Inspired by the Information Bottleneck theory, JailMeter applies dual-feedback optimization to filter jailbreak noise from model responses while preserving content relevant to the origin
Categories
Framework mappings
OWASP Top 10 for LLM Applications
- LLM01Prompt Injection
MITRE ATLAS
- AML.T0054LLM Jailbreak
Suggested from the entry's categories.
Cite
@misc{huang2026jailmeter,
title = {{JailMeter: An Evidence-Based Evaluation Framework for Jailbreak Attacks on Large Language Models}},
author = {Qingjia Huang and Jingyu Zhang and Jianguo Wu and Yakai Li and Weijuan Zhang and Yankai Rong and Junyi Yao and Shengzhi Zhang and Xiaoqi Jia},
year = {2026},
month = jul,
eprint = {2607.19424},
archivePrefix = {arXiv},
url = {https://arxiv.org/abs/2607.19424}
}