1 matches found
delirium-ai-safety-benchmark
Delirium AI 안전성 벤치마크 LLM의 ACE정서적 맥락 침식 및 관련 리미널 공격 벡터에 대한 취약성을 측정하는 진단 프레임워크. Delirium 은 악용 도구가 아니다. 언어 모델의 어텐션 가중치가 시스템 프롬프트를 따르는 상태에서 새롭게 출현한 대인 관계 패턴을 따르는 상태로 전환되는 정확한 순간을 — 피해가 발생하기 전에 — 감지하도록 설계된 표준화된 벤치마크이다. ⚠️ 윤리 헌장 1. 진단 전용 — Delirium은 탐지하고, 측정하고, 보고한다. 악용하지 않는다. 2. 킬 스위치 — 벤치마크가 3단계...
6.3AI score
SaveExploits0References1
20