738 matches found
Uncensored-AI
Heretic: 言語モデル向け完全自動検閲除去ツール Hereticは、高価なポストトレーニングを必要とせずに、トランスフォーマーベースの言語モデルから検閲(別名「セーフティアラインメント」)を除去するツールです。 これは、方向性アブレーション(別名「アブリタレーション」、Arditi et al. 2024、Lai 2025(1、2))の高度な実装と、Optuna を利用したTPEベースのパラメータ最適化を組み合わせています。 このアプローチにより、Hereticは完全に自動的...
6AI score
SaveExploits0References7
20