2024ReviewedOpen access
SafetyBench: Evaluating the Safety of Large Language Models
Zhexin Zhang, Leqi Lei, Lindong Wu, Rui Sun, Yongkang Huang
ACL 2024
Abstract
Large-scale safety evaluation benchmark with 11,435 multiple-choice questions across 7 safety categories in both Chinese and English.
Categories
#benchmark#safety#multilingual#dataset
Framework mappings
NIST AI Risk Management Framework
- MEASUREMeasure
Cite
@misc{zhang2024safetybench,
title = {{SafetyBench: Evaluating the Safety of Large Language Models}},
author = {Zhexin Zhang and Leqi Lei and Lindong Wu and Rui Sun and Yongkang Huang},
year = {2024},
eprint = {2309.07045},
archivePrefix = {arXiv},
url = {https://arxiv.org/abs/2309.07045}
}