July 2026Unreviewed
Efficient Safety Alignment of Language Models via Latent Personality Traits
Mohamed Amine Merzouk, Nolan Smyth, Damiano Fornasiere, Linh Le, David Williams-King, Adam Oberman
Abstract
Current safety methods for large language models are known to be vulnerable to adversarial attacks, motivating research into robust alternatives. Latent Adversarial Training (LAT) is among the most effective defenses, but can degrade utility and requires training on large datasets of harmful prompts. We introduce Latent Personality Alignment (LPA), which replaces explicit harm refusal with adversarial training on just 66 harm-agnostic statements drawn from psychometric personality literature. We
Categories
Framework mappings
MITRE ATLAS
- AML.T0043Craft Adversarial Data
Suggested from the entry's categories.
Cite
@misc{merzouk2026efficient,
title = {{Efficient Safety Alignment of Language Models via Latent Personality Traits}},
author = {Mohamed Amine Merzouk and Nolan Smyth and Damiano Fornasiere and Linh Le and David Williams-King and Adam Oberman},
year = {2026},
month = jul,
eprint = {2607.07918},
archivePrefix = {arXiv},
url = {https://arxiv.org/abs/2607.07918}
}