September 2026Unreviewed
VIBE-Bench: Evaluating Personalized Large Language Models When Profiles Don't Mean Preferences
Yiwen Jiang, Yang Deng, Stephanie Fong, Zimu Wang, Yaling Shen, Wei Feng, Hongxi Yang, Xiangyu Zhao, Zhongxing Xu, Deval Mehta, Xuelian Cheng, Zongyuan Ge
Abstract
Personalized Large Language Models (PLLMs) aim to tailor responses to individual users, where a central challenge is preference reasoning: inferring query-relevant preferences from user-related history. Existing benchmarks, however, largely assume that such preference can be retrieved from semantically related history. We study an underexplored but practically important regime, profile-preference conceptual misalignment (PRCM), where observable profile cues and query-specific preferences lie in
Categories
Cite
@misc{jiang2026vibebench,
title = {{VIBE-Bench: Evaluating Personalized Large Language Models When Profiles Don't Mean Preferences}},
author = {Yiwen Jiang and Yang Deng and Stephanie Fong and Zimu Wang and Yaling Shen and Wei Feng and Hongxi Yang and Xiangyu Zhao and Zhongxing Xu and Deval Mehta and Xuelian Cheng and Zongyuan Ge},
year = {2026},
month = sep,
eprint = {2609.00921},
archivePrefix = {arXiv},
url = {https://arxiv.org/abs/2609.00921}
}