Lucene search
+L

173 matches found

Kitploit
Kitploit
added 2026/09/03 3:25 p.m.3 views

AutoRAN-public

🧠 AutoRAN:大規模推論モデルにおけるセーフティ推論の自動ハイジャック AutoRAN は、セーフティ推論の自動ハイジャックであり、アライメントが低い(二次的な)補助モデルを活用して推論トレースをシミュレートし、ナラティブプロンプトを生成し、それらのプロンプトを反復的に洗練させることで、現代の大規模推論モデル(LRM)におけるセーフティ推論をバイパスします。 ⚠️ 免責事項 : このリポジトリは、管理されたセキュリティ研究およびAI安全性のレッドチーミングのみを目的としています。 🔍 主な特徴 ⚙️ 反復的なプロンプト洗練による自動マルチターン脱獄 🧩 ナラティブテンプレート...

5.9AI score
SaveExploits0
Rows per page
Query Builder