Skip to content
Search
paperJuly 2026Unreviewed

Efficient Safety Alignment of Language Models via Latent Personality Traits

Mohamed Amine Merzouk, Nolan Smyth, Damiano Fornasiere, Linh Le, David Williams-King, Adam Oberman

Abstract

Current safety methods for large language models are known to be vulnerable to adversarial attacks, motivating research into robust alternatives. Latent Adversarial Training (LAT) is among the most effective defenses, but can degrade utility and requires training on large datasets of harmful prompts. We introduce Latent Personality Alignment (LPA), which replaces explicit harm refusal with adversarial training on just 66 harm-agnostic statements drawn from psychometric personality literature. We

Categories

Framework mappings

MITRE ATLAS
  • AML.T0043Craft Adversarial Data

Suggested from the entry's categories.

Cite

@misc{merzouk2026efficient,
  title = {{Efficient Safety Alignment of Language Models via Latent Personality Traits}},
  author = {Mohamed Amine Merzouk and Nolan Smyth and Damiano Fornasiere and Linh Le and David Williams-King and Adam Oberman},
  year = {2026},
  month = jul,
  eprint = {2607.07918},
  archivePrefix = {arXiv},
  url = {https://arxiv.org/abs/2607.07918}
}