1 matches found
deleting-the-trace
针对使用工具代理的控制令牌注入攻击 针对使用工具的语言模型代理的两种输入级攻击研究的代码和记录测量结果。第一种攻击将模型自身通道控制令牌的短字符串附加到不可信输入中;分词器将其读取为已关闭的推理通道,因此模型不输出思维链,直接进行工具调用。这删除了监控器所依赖的推理轨迹,并且在模型原本会拒绝的请求上,将拒绝转化为已完成的动作。第二个结果是,相同的工具调用生成是否实际触发由测试框架解析器而非模型决定,因此代理的鲁棒性是模型及其解码和解析测试框架的联合属性。 每个实验都以全精度(bfloat16)运行,通过发布的工具沙箱进行贪婪解码,results/ 下记录的 JSON 完全由这里的脚本生成...
6.2AI score
SaveExploits0
20