Skip to content
Search
paperApril 2025Unreviewed

Benchmarking adversarial robustness to bias elicitation in large language models: scalable automated assessment with LLM-as-a-judge

Riccardo Cantini, A. Orsino, Massimo Ruggiero, Domenico Talia

Machine-mediated learning

Abstract

The growing integration of Large Language Models (LLMs) into critical societal domains has raised concerns about embedded biases that can perpetuate stereotypes and undermine fairness. Such biases may stem from historical inequalities in training data, linguistic imbalances, or adversarial manipulation. Despite mitigation efforts, recent studies show that LLMs remain vulnerable to adversarial attacks that elicit biased outputs. This work proposes a scalable benchmarking framework to assess LLM r

Categories

Framework mappings

MITRE ATLAS
  • AML.T0043Craft Adversarial Data

Suggested from the entry's categories.

Cite

@article{cantini2025benchmarking,
  title = {{Benchmarking adversarial robustness to bias elicitation in large language models: scalable automated assessment with LLM-as-a-judge}},
  author = {Riccardo Cantini and A. Orsino and Massimo Ruggiero and Domenico Talia},
  year = {2025},
  month = apr,
  journal = {Machine-mediated learning},
  eprint = {2504.07887},
  archivePrefix = {arXiv},
  doi = {10.1007/s10994-025-06862-6},
  url = {https://www.semanticscholar.org/paper/a6db5ffa1a82b3d969f184b22e376ca04203b2dc}
}