Lucene search
+L

1 matches found

Packet Storm News
Packet Storm News
added 2025/06/14 12:0 a.m.7 views

SOSBENCH: Benchmarking Safety Alignment on Scientific Knowledge

Large language models LLMs exhibit advancing capabilities in complex tasks, such as reasoning and graduate-level question answering, yet their resilience against misuse, particularly involving scientifically sophisticated risks, remains underexplored. Existing safety benchmarks typically focus...

7.2AI score
SaveExploits0
Rows per page
Query Builder