1 matches found
SecOPD
SecOPD: オンポリシー蒸留による適応型プロンプトインジェクションの軽減 Yibo Peng · Long Lian · David Wagner† · Sizhe Chen† † 共同指導。 論文 プロジェクトページ モデル このリリースは、論文の最終的なfull-response KL 定式化を実装したものであり、 no-parsing バリアントとも呼ばれます。生徒モデルは攻撃されたコンテキスト下で ロールアウトします。同じベースモデルから初期化されたクリーンコンテキストの教師モデルが、 ペアとなるクリーンコンテキスト下で生徒モデルのサンプリングされたトークンをスコアリングしま...
5.4AI score
SaveExploits0References3
20