Lucene search
+L

1 matches found

Packet Storm News
Packet Storm News
•added 2026/06/25 12:00 a.m.•21 views

Inherited Circuits, Learned Semantics: How Fine-Tuning Creates Evasion Vulnerabilities Invisible to Standard Evaluation

LLMs fine-tuned for security classification are usually evaluated on held-out examples from the same distribution as their training data. We show that this can miss vulnerabilities introduced by fine-tuning itself: models can learn token-level indicator semantics that preserve canonical accuracy...

5.9AI score
SaveExploits0
Rows per page
Query Builder