2 matches found
FuzzingBrain-Bench
FuzzingBrain Bench LLM駆動の脆弱性再現のためのベンチマーク。43のオープンソースプロジェクト(C / C++ / Java)における77件の実在するゼロデイバグを対象としています。 各チャレンジでは、エージェントにファズハーネス (ターゲット)と、脆弱性のあるリビジョンでのプロジェクトソースのみが与えられます。パッチ、修正コミット、ターゲット行は一切提供されません。エージェントは、サニタイザの下で障害を再トリガーする入力を発見する必要があります。すべての評価は決定的 (LLM-as-judgeではない)であり、イメージ内かつオフライン...
6.2AI score
SaveExploits0References1
FuzzingBrain-Bench V1: Evaluating Open-Ended Bug Discovery by LLMs
Evaluating the ability of large language models LLMs to discover software bugs is increasingly important. Existing benchmarks typically evaluate this capability by asking the model to generate a proof-of-concept input that triggers a predefined target vulnerability. However, this setup may overlo...
5.6AI score
SaveExploits0
20