1 matches found
Reflections and Fragments: Securing LLMs against Sequential Mosaic Attacks
Self-play red-teaming improves language-model safety by pitting attacker and defender roles against each other in a zero-sum game. However, real adversaries increasingly use mosaic attacks: multi-turn sequences whose individual fragments are innocuous in isolation yet assemble into a harmful...
SaveExploits0
20