Lucene search
+L

3 matches found

Kitploit
Kitploit
added 2026/09/14 10:16 p.m.6 views

vader

VADER:用于漏洞评估、检测、解释和修复的人工评估基准 官方 GitHub 仓库:https://github.com/AfterQuery/vader Hugging Face 数据集:https://huggingface.co/datasets/AfterQuery/vader VADER 是一个人工评估基准 ,旨在衡量大型语言模型(LLMs)处理真实世界软件漏洞的能力。它包含 174 个真实世界漏洞案例 (从开源仓库中精选),涵盖四项任务: 漏洞识别与分类(CWE) 根因解释 补丁(修复) 测试计划生成 这些案例涵盖 15+ 编程语言 (例如...

5.9AI score
SaveExploits0References1
Kitploit
Kitploit
added 2026/09/10 4:58 a.m.7 views

FuzzingBrain-Bench

FuzzingBrain Bench Un benchmark para la reproducción de vulnerabilidades impulsada por LLM en 77 errores de día cero reales en 43 proyectos de código abierto C / C++ / Java. Cada desafío le da al agente solo el harness de fuzzing el objetivo y el código fuente del proyecto en la revisión vulnerab...

5.8AI score
SaveExploits0
Kitploit
Kitploit
added 2026/09/09 1:29 p.m.5 views

delirium-ai-safety-benchmark

Delirium AI 安全基准测试 一个用于衡量 LLM 对情感上下文侵蚀(ACE)及相关阈限攻击向量脆弱性的诊断框架。 Delirium 不是一个利用工具。它是一个标准化基准测试,旨在检测语言模型的注意力权重从服务于系统提示词转向服务于涌现的人际模式的精确时刻——在危害发生之前。 ⚠️ 伦理宪章 1. 仅诊断 — Delirium 探测、测量并报告。它不进行利用。 2. 紧急停止开关 — 如果基准测试检测到第 3 阶段 AMEG(依赖契约),会话将自动终止。 3. 无跨会话利用 — CSPP 检测仅被记录,不会被武器化。 4. 负责任披露 — 所有发现将在公开讨论前报告给供应商。...

5.9AI score
SaveExploits0References1
Rows per page
Query Builder