1 matches found
Reactivating Alignment: Defending LLMs from Jailbreaks Via Intention-Aware Input-Output Matching
Large language models LLMs remain vulnerable to jailbreak attacks that conceal harmful intent within complex adversarial prompts. Existing defenses primarily rely on input perturbation or harmful-output suppression, but they rarely model where malicious intent resides, resulting in brittle...
SaveExploits0
20