Lucene search
+L

1 matches found

Packet Storm News
Packet Storm News
added 2025/11/16 12:0 a.m.8 views

Scaling Patterns in Adversarial Alignment: Evidence from Multi-LLM Jailbreak Experiments

Large language models LLMs increasingly operate in multi-agent and safety-critical settings, raising open questions about how their vulnerabilities scale when models interact adversarially. This study examines whether larger models can systematically jailbreak smaller ones - eliciting harmful or...

6.9AI score
SaveExploits0
Rows per page
Query Builder