Lucene search
+L

1 matches found

Packet Storm News
Packet Storm News
added 2025/07/26 12:0 a.m.9 views

SDD: Self-Degraded Defense against Malicious Fine-Tuning

Open-source Large Language Models LLMs often employ safety alignment methods to resist harmful instructions. However, recent research shows that maliciously fine-tuning these LLMs on harmful data can easily bypass these safeguards. To counter this, we theoretically uncover why malicious fine-tuni...

7.1AI score
SaveExploits0
Rows per page
Query Builder