Lucene search
+L

1 matches found

Packet Storm News
Packet Storm News
•added 2026/10/03 12:00 a.m.•4 views

Reactivating Alignment: Defending LLMs from Jailbreaks Via Intention-Aware Input-Output Matching

Large language models LLMs remain vulnerable to jailbreak attacks that conceal harmful intent within complex adversarial prompts. Existing defenses primarily rely on input perturbation or harmful-output suppression, but they rarely model where malicious intent resides, resulting in brittle...

SaveExploits0
Rows per page
Query Builder