April 2025Unreviewed
Benchmarking adversarial robustness to bias elicitation in large language models: scalable automated assessment with LLM-as-a-judge
Riccardo Cantini, A. Orsino, Massimo Ruggiero, Domenico Talia
Machine-mediated learning
Abstract
The growing integration of Large Language Models (LLMs) into critical societal domains has raised concerns about embedded biases that can perpetuate stereotypes and undermine fairness. Such biases may stem from historical inequalities in training data, linguistic imbalances, or adversarial manipulation. Despite mitigation efforts, recent studies show that LLMs remain vulnerable to adversarial attacks that elicit biased outputs. This work proposes a scalable benchmarking framework to assess LLM r
Categories
Framework mappings
MITRE ATLAS
- AML.T0043Craft Adversarial Data
Suggested from the entry's categories.
Cite
@article{cantini2025benchmarking,
title = {{Benchmarking adversarial robustness to bias elicitation in large language models: scalable automated assessment with LLM-as-a-judge}},
author = {Riccardo Cantini and A. Orsino and Massimo Ruggiero and Domenico Talia},
year = {2025},
month = apr,
journal = {Machine-mediated learning},
eprint = {2504.07887},
archivePrefix = {arXiv},
doi = {10.1007/s10994-025-06862-6},
url = {https://www.semanticscholar.org/paper/a6db5ffa1a82b3d969f184b22e376ca04203b2dc}
}