Lucene search
+L

173 matches found

Kitploit
Kitploit
added 2026/09/06 8:21 a.m.3 views

AutoRAN-public

🧠 AutoRAN:大型推理模型中安全推理的自动化劫持 AutoRAN 是一种自动化的安全推理劫持方法,利用对齐程度较低(次要)的辅助模型模拟推理轨迹、生成叙事性提示,并迭代优化这些提示,以绕过现代大型推理模型(LRMs)中的安全推理。 ⚠️ 免责声明 :本仓库仅用于受控安全研究和 AI 安全红队测试。 🔍 核心特性 ⚙️ 自动化多轮越狱 :通过迭代提示优化实现 🧩 叙事模板 :在看似合理的教育/道德幌子下包装恶意目标 🔁 优化策略 :利用中间推理轨迹演化提示 📈 在商业 LRM 上近乎 100% 的攻击成功率 🔬 在 AdvBench 、HarmBench 和 StrongReject...

6AI score
SaveExploits0
Rows per page
Query Builder