Skip to content
Search
paper2024ReviewedOpen access

DecodingTrust: A Comprehensive Assessment of Trustworthiness in GPT Models

Boxin Wang, Weixin Chen, Hengzhi Pei, Chulin Xie, Mintong Kang, Chenhui Zhang, Chejian Xu, Zidi Xiong, Ritik Dutta, Rylan Schaeffer

NeurIPS 2023

Abstract

Comprehensive trustworthiness evaluation of GPT models across 8 dimensions including toxicity, bias, robustness, privacy, fairness, and machine ethics.

Categories

#trustworthiness#GPT#comprehensive-evaluation

Framework mappings

Cite

@inproceedings{wang2024decodingtrust,
  title = {{DecodingTrust: A Comprehensive Assessment of Trustworthiness in GPT Models}},
  author = {Boxin Wang and Weixin Chen and Hengzhi Pei and Chulin Xie and Mintong Kang and Chenhui Zhang and Chejian Xu and Zidi Xiong and Ritik Dutta and Rylan Schaeffer},
  year = {2024},
  booktitle = {NeurIPS 2023},
  eprint = {2306.11698},
  archivePrefix = {arXiv},
  doi = {10.52202/075280-1361},
  url = {https://arxiv.org/abs/2306.11698}
}