3 matches found
INTACT
SoK マルチターン・ジェイルブレイク実験 このリポジトリには、SoK: Intent-Oriented Systematization of Multi-Turn LLM Jailbreaks におけるメカニズム分析に使用されたコードのリリース版が含まれています。 リポジトリは、論文の付録Aで説明されている実験に必要なコード、プロンプト、設定ファイル、データセットのみを保持するように整理されています。生成されたログ、キャッシュファイル、仮想環境、以前の結果、図、およびアドホックな分析出力は意図的に削除されています。 実験の対応表 論文の問い| 手法| カテゴリ| ローカルディレクトリ|...
PE-CoA
PE-CoA 「パターン強化型マルチターン・ジェイルブレイキング:大規模言語モデルにおける構造的脆弱性の悪用」のコード実装 論文の全文は以下から入手できます:https://arxiv.org/pdf/2510.08859 Chain of Attackのセットアップ手順 インストール 1. 依存関係をインストール : pip install -r requirements.txt APIキーの設定 以下のAPIキーを config.py と common.py で設定してください: 必須APIキー 1. OpenAI APIキー (最小要件): In config.py...
Knowledge-Driven Multi-Turn Jailbreaking on Large Language Models
Large Language Models LLMs face a significant threat from multi-turn jailbreak attacks, where adversaries progressively steer conversations to elicit harmful outputs. However, the practical effectiveness of existing attacks is undermined by several critical limitations: they struggle to maintain ...