Yuvion LLM: An Adversarially-Aware Large Language Model for Content And AI Safety
Ting Ma, Xiufeng Huang, Benlei Cui, Xiaowen Xu, Shikai Qiu, Ruijie Jian, Hongxing Li, Guanghui Wang, Longtao Huang, Haiwen Hong, Haolei Xu, Wenjing Jiang, Ziwen Xu, Zhaoyu Fan, Shaoxuan He, Chuxi Xiao, Yujian Li, Xinyue Chen, Chunyang Chai, Wenxuan Liu, Ziheng Wang, Dongjie Zhang, Yangfan Zhou, Libin Dong, Yupeng Cao, Xiaoqian Xia, Jing Wang, Zhe Jiang, Zhenan Ye, Guang Yang, Bin Liu, Wei Peng, Ziqiang Zhu, Meihui Lian, Kaiwen Lv Kacuila, Haidong Ding, Bingyu Zhu, Yan Wang, Hai Zhao, Xuan Jin, Wei Zhao, Pengfei Sun, Wei Wang, Huiming Zhang, Bin Li, Hui Xue
Abstract
As large language models are increasingly deployed in real-world systems, safety failures can still lead to harmful outputs and dangerous misuse. We argue that the essence of safety is adversarial: many failures arise not from natural inputs alone, but from strategic attempts to evade model policies and safeguards. However, existing general-purpose model development largely overlook this adversarial nature, and often remain insufficient for realistic safety scenarios involving planning, tool use
Categories
Framework mappings
- ASI02Tool Misuse & Exploitation
- AML.T0053AI Agent Tool Invocation
Suggested from the entry's categories.
Cite
@misc{ma2026yuvion,
title = {{Yuvion LLM: An Adversarially-Aware Large Language Model for Content And AI Safety}},
author = {Ting Ma and Xiufeng Huang and Benlei Cui and Xiaowen Xu and Shikai Qiu and Ruijie Jian and Hongxing Li and Guanghui Wang and Longtao Huang and Haiwen Hong and Haolei Xu and Wenjing Jiang and Ziwen Xu and Zhaoyu Fan and Shaoxuan He and Chuxi Xiao and Yujian Li and Xinyue Chen and Chunyang Chai and Wenxuan Liu and Ziheng Wang and Dongjie Zhang and Yangfan Zhou and Libin Dong and Yupeng Cao and Xiaoqian Xia and Jing Wang and Zhe Jiang and Zhenan Ye and Guang Yang and Bin Liu and Wei Peng and Ziqiang Zhu and Meihui Lian and Kaiwen Lv Kacuila and Haidong Ding and Bingyu Zhu and Yan Wang and Hai Zhao and Xuan Jin and Wei Zhao and Pengfei Sun and Wei Wang and Huiming Zhang and Bin Li and Hui Xue},
year = {2026},
month = jun,
eprint = {2606.27632},
archivePrefix = {arXiv},
url = {https://arxiv.org/abs/2606.27632}
}