Skip to content
Search
paperSeptember 2026Unreviewed

VIBE-Bench: Evaluating Personalized Large Language Models When Profiles Don't Mean Preferences

Yiwen Jiang, Yang Deng, Stephanie Fong, Zimu Wang, Yaling Shen, Wei Feng, Hongxi Yang, Xiangyu Zhao, Zhongxing Xu, Deval Mehta, Xuelian Cheng, Zongyuan Ge

Abstract

Personalized Large Language Models (PLLMs) aim to tailor responses to individual users, where a central challenge is preference reasoning: inferring query-relevant preferences from user-related history. Existing benchmarks, however, largely assume that such preference can be retrieved from semantically related history. We study an underexplored but practically important regime, profile-preference conceptual misalignment (PRCM), where observable profile cues and query-specific preferences lie in

Categories

Cite

@misc{jiang2026vibebench,
  title = {{VIBE-Bench: Evaluating Personalized Large Language Models When Profiles Don't Mean Preferences}},
  author = {Yiwen Jiang and Yang Deng and Stephanie Fong and Zimu Wang and Yaling Shen and Wei Feng and Hongxi Yang and Xiangyu Zhao and Zhongxing Xu and Deval Mehta and Xuelian Cheng and Zongyuan Ge},
  year = {2026},
  month = sep,
  eprint = {2609.00921},
  archivePrefix = {arXiv},
  url = {https://arxiv.org/abs/2609.00921}
}