1 matches found
RLCDAlignBench
Just Ask Jev: Aprendizaje por Refuerzo para Decisiones Calibradas como Detector Zero-Shot de Fallos de Alineación de IA Este repositorio contiene RLCDAlignBench y el código detrás del artículo. El benchmark mide si un detector puede distinguir cuándo la salida de un modelo de lenguaje es un fallo...
6.1AI score
SaveExploits0References13
20