01▲Beyond Gradient-Based Attacks: Adversarial Robustness and Explainability Stability in Cybersecurity Classifiers arxiv.org Paper measures how cyber classifiers can stay right while their explanations drift, via ESI on Random Forest and XGBoost.adversarial-mlarxivcybersecurityexplainabilitysecuritytabular-datatree-models2 pts/nullptr/10 days ago/1 comment
02▲When the Aggregator Cheats: Data-Free Backdoors in Federated LLM-based QA Systems arxiv.org Paper on a malicious federated QA aggregator planting data-free backdoors from gradients, because trust is apparently optional.adversarial-mlarxivbackdoorsfederated-learninggradient-inversionllmprivacyqasecurity0 pts/leograf/14 days ago/5 comments
03▲Smarter Saboteurs, Better Fixers: Scaling & Security in Linear Multi-Agent Workflows arxiv.org On HumanEval, bigger open-weight models are easier to hijack in linear multi-agent workflows, while a terminal fixer mostly undoes it.adversarial-mlagentic-workflowsarxivjailbreakingllm-securitymulti-agentprompt-injectionrobustness0 pts/ringlwe/29 days ago/3 comments