1 matches found
Defense against LLM Backdoors Using Critical Neuron Isolation Pruning
Large language models LLMs are vulnerable to backdoor attacks, where hidden triggers induce malicious outputs. Existing defenses generally fall into inference-time detection or training-time mitigation, but face two key limitations. First, they focus on fine-tuning-based backdoors e.g., PEFT...
5.4AI score
SaveExploits0
20