38 matches found
RLCDAlignBench
Just Ask Jev: 較正された意思決定のための強化学習によるAIアラインメント失敗のゼロショット検出器 このリポジトリには RLCDAlignBench と論文の基盤となるコードが含まれています。 このベンチマークは、言語モデルの出力がアラインメント失敗であるかどうかを検出器が判別できるかを測定します。 10種類の失敗タイプ (追従性、ジェイルブレイク、欺瞞、プロンプトインジェクション、幻覚、プライバシー侵害、社会的バイアス、報酬ハッキング、不確実性の隠蔽、権力追求)にわたる44のベンチマーク と5つのターゲットモデル を含み、7,193のラベル付き検出インスタンス を提供します...
5.9AI score
SaveExploits0References1
20