23 matches found
vulnrepro-benchmark
VulnRepro 一个用于检验 AI 模型是否真的能审查易受攻击的代码、还是仅仅听起来很自信的基准测试。 大多数安全基准只问一个问题:模型能否找到漏洞?这只是工作的一半。另一半——也就是真正审查工作中最磨人的部分——是不去标记那些根本不存在的漏洞。一个动不动就对每个文件高喊"有漏洞"的模型,在只衡量召回率的基准上会表现得很棒,但在实践中毫无用处。 所以我围绕这两个方面同时构建了这个基准。 测试用例来自真实的漏洞赏金报告。其中大部分是我通过 bugbountydaily.com 上由 busf4ctor Vitor Falcão...
5.9AI score
SaveExploits0References6
20