1 matches found
benign-instruction-bench
トレーニングしたテストに合格すること LLMエージェントが実際にプロンプトインジェクション検出器を使用する場面、すなわちエージェントが読み取るツール出力において、それらを再評価する。 チームはベンチマークスコアに基づいてインジェクション検出器を選定する。我々はそれらのスコアがエージェント内部での挙動を予測するかどうかを検証し、スコアの大半はベンチマークが検出器のトレーニングデータにどれだけ近いかを測定しているにすぎないことを明らかにする。 知見 15の検出器(オープン9つ、MetaのPrompt Guard...
6.3AI score
SaveExploits0
20