September 2026Unreviewed
Capability-Gated Language Models: Security Composes, Utility Does Not
Patrikas Vanagas, Augustas Mačijauskas, Laurynas Lopata
Abstract
Deployed language model safeguards (safety fine-tuning, filtering, unlearning) vary by principal only outside the model weights: filters are reconfigured, tiers are multiplied, and artefacts are reissued; inside one set of weights every request meets the same model configuration. This motivates us to define capability-gated deployment: per-principal access control inside one set of weights, whose configurations form a lattice - meets accumulate a principal's restrictions and joins pool a coaliti
Categories
Cite
@misc{vanagas2026capabilitygated,
title = {{Capability-Gated Language Models: Security Composes, Utility Does Not}},
author = {Patrikas Vanagas and Augustas Mačijauskas and Laurynas Lopata},
year = {2026},
month = sep,
eprint = {2609.00445},
archivePrefix = {arXiv},
url = {https://arxiv.org/abs/2609.00445}
}