1 matches found
Towards a Unified Misuse Monitoring Benchmark
LLM agents increasingly act in multi-actor environments, exposing them to misuse from multiple sources: decomposition attacks, where a harmful request is split into innocuous sub-requests, and prompt injection attacks, where a compromised tool delivers a malicious instruction. Existing evaluation...
5.9AI score
SaveExploits0
20