Lucene search
+L

2 matches found

Packet Storm News
Packet Storm News
added 2025/09/28 12:0 a.m.6 views

Quant Fever, Reasoning Blackholes, Schrodinger'S Compliance, and More: Probing GPT-OSS-20B

OpenAI's GPT-OSS family provides open-weight language models with explicit chain-of-thought CoT reasoning and a Harmony prompt format. We summarize an extensive security evaluation of GPT-OSS-20B that probes the model's behavior under different adversarial conditions. Using the Jailbreak Oracle J...

6.8AI score
SaveExploits0
Packet Storm News
Packet Storm News
added 2025/08/08 12:0 a.m.4 views

Beyond Uniform Criteria: Scenario-Adaptive Multi-Dimensional Jailbreak Evaluation

Precise jailbreak evaluation is vital for LLM red teaming and jailbreak research. Current approaches employ binary classification e.g., string matching, toxic text classifiers, LLM-driven methods, yielding only "yes/no" labels without quantifying harm intensity. Existing multi-dimensional...

7AI score
SaveExploits0
Rows per page
Query Builder