3 matches found
bloom
Bloom: Evaluaciones Automatizadas de Comportamiento para LLMs !IMPORTANT Bloom tiene un nuevo hogar. Ahora es desarrollado y mantenido por Meridian Labs y vive en meridianlabs-ai.github.io/petribloom — todas las nuevas funcionalidades y correcciones llegarán allí. Este repositorio está congelado ...
RLCDAlignBench
Just Ask Jev: Aprendizaje por Refuerzo para Decisiones Calibradas como Detector Zero-Shot de Fallos de Alineación de IA Este repositorio contiene RLCDAlignBench y el código detrás del artículo. El benchmark mide si un detector puede distinguir cuándo la salida de un modelo de lenguaje es un fallo...
Phare: a Safety Probe for Large Language Models
Ensuring the safety of large language models LLMs is critical for responsible deployment, yet existing evaluations often prioritize performance over identifying failure modes. We introduce Phare, a multilingual diagnostic framework to probe and evaluate LLM behavior across three critical...