1 matches found
Exponentiated-Gradient-Descent-LLM-Attack
Readme 파일 변경. 이 프로젝트는 정렬된 대규모 언어 모델을 공격하기 위한 적대적 접미사를 생성하는 지수 경사 하강Exponentiated Gradient Descent 최적화 방법을 탐구합니다. 이 방법은 70억 개의 매개변수를 가진 Llama-2 채팅 모델에서 효과적인 것으로 나타났습니다. 여러 행동예: 20개에 대해 pgd 스크립트를 실행하려면 셸에서 다음 명령을 실행하십시오. python runpgd.py --inputfile...
5.9AI score
SaveExploits0
20