173 matches found
AutoRAN-public
🧠 AutoRAN:大規模推論モデルにおけるセーフティ推論の自動ハイジャック AutoRAN は、セーフティ推論の自動ハイジャックであり、アライメントが低い(二次的な)補助モデルを活用して推論トレースをシミュレートし、ナラティブプロンプトを生成し、それらのプロンプトを反復的に洗練させることで、現代の大規模推論モデル(LRM)におけるセーフティ推論をバイパスします。 ⚠️ 免責事項 : このリポジトリは、管理されたセキュリティ研究およびAI安全性のレッドチーミングのみを目的としています。 🔍 主な特徴 ⚙️ 反復的なプロンプト洗練による自動マルチターン脱獄 🧩 ナラティブテンプレート...
5.9AI score
SaveExploits0
20