Skip to content
Search
paperSeptember 2026Unreviewed

Capability-Gated Language Models: Security Composes, Utility Does Not

Patrikas Vanagas, Augustas Mačijauskas, Laurynas Lopata

Abstract

Deployed language model safeguards (safety fine-tuning, filtering, unlearning) vary by principal only outside the model weights: filters are reconfigured, tiers are multiplied, and artefacts are reissued; inside one set of weights every request meets the same model configuration. This motivates us to define capability-gated deployment: per-principal access control inside one set of weights, whose configurations form a lattice - meets accumulate a principal's restrictions and joins pool a coaliti

Categories

Cite

@misc{vanagas2026capabilitygated,
  title = {{Capability-Gated Language Models: Security Composes, Utility Does Not}},
  author = {Patrikas Vanagas and Augustas Mačijauskas and Laurynas Lopata},
  year = {2026},
  month = sep,
  eprint = {2609.00445},
  archivePrefix = {arXiv},
  url = {https://arxiv.org/abs/2609.00445}
}