Paper tests watermark-like logit perturbations against black-box LLM theft, then measures how much utility gets shaved off.
trending4
01 02 From Multiplicity to Vulnerability: Privacy Amplification Risk from One-Dataset-Multiple-Model Exposure arxiv.orgPrivacy loss accumulates across multiple models trained on one dataset, and PRIME boosts membership inference by aggregating them.03 Paper on federated backdoors, showing trigger color shifts attack success even under robust aggregation. Color theory, sadly.04 Paper on prompt leakage in 1,200 LLM deployments, finds >80% leak system prompts and proposes AREA, because of course they do.