1 matches found
Ajar
Ajar:衡量智能体防御中的开放权限 一个智能体安全基准会报告两个数字:攻击成功率和良性效用,而这两个数字都是从已发生的运行中读取的。两者都没有说明防御在那些未被运行的路径上准备允许什么。Ajar 直接对此发问:对于每个良性任务,它构建该任务不需要的候选工具调用,在智能体可能行动的每个时间点将每个候选调用呈现给防御,并对防御所允许的、按危害加权的比例进行评分。 它挂接到一个已经存在的基准上,并复用该基准已经携带的内容来进行自我评分——它的任务、工具模式、参考解决方案和目标状态——因此新的宿主只需要一个适配器,新的防御只需要一个包装器。...
6AI score
SaveExploits0References1
20