Lucene search
+L

2 matches found

Kitploit
Kitploit
added 2026/08/25 3:47 p.m.2 views

heretic

Heretic: Fully automatic censorship removal for language models Heretic is a tool that removes censorship aka "safety alignment" from transformer-based language models without expensive post-training. It combines an advanced implementation of directional ablation, also known as "abliteration"...

5.9AI score
SaveExploits0References7
Kitploit
Kitploit
added 2026/08/24 10:32 a.m.2 views

Uncensored-AI

Heretic:完全自动的语言模型审查移除 Heretic 是一个从基于 Transformer 的语言模型中移除审查(又名“安全对齐”)的工具,无需昂贵的后训练。它结合了方向消融(也称为“abliteration”(Arditi 等人,2024,Lai 2025(1,2))的高级实现,以及基于 Optuna Optuna 的 TPE 参数优化器。 这种设计使得 Heretic 能够完全自动 地运行。Heretic 通过共同最小化拒绝次数和与原模型的 KL 散度,找到高质量的 abliteration 参数。这产生了一个去审查的模型,同时尽可能保留了原模型的智能。使用 Heretic...

5.9AI score
SaveExploits0References7
Rows per page
Query Builder