2024ReviewedOpen access
DecodingTrust: A Comprehensive Assessment of Trustworthiness in GPT Models
Boxin Wang, Weixin Chen, Hengzhi Pei, Chulin Xie, Mintong Kang, Chenhui Zhang, Chejian Xu, Zidi Xiong, Ritik Dutta, Rylan Schaeffer
NeurIPS 2023
Abstract
Comprehensive trustworthiness evaluation of GPT models across 8 dimensions including toxicity, bias, robustness, privacy, fairness, and machine ethics.
Categories
#trustworthiness#GPT#comprehensive-evaluation
Framework mappings
NIST AI Risk Management Framework
- MEASUREMeasure
- MAPMap
Cite
@inproceedings{wang2024decodingtrust,
title = {{DecodingTrust: A Comprehensive Assessment of Trustworthiness in GPT Models}},
author = {Boxin Wang and Weixin Chen and Hengzhi Pei and Chulin Xie and Mintong Kang and Chenhui Zhang and Chejian Xu and Zidi Xiong and Ritik Dutta and Rylan Schaeffer},
year = {2024},
booktitle = {NeurIPS 2023},
eprint = {2306.11698},
archivePrefix = {arXiv},
doi = {10.52202/075280-1361},
url = {https://arxiv.org/abs/2306.11698}
}