
该论文聚焦于大语言模型(LLMs)面临的对抗攻击问题,提出了一种信息论框架来量化攻击中信息泄露的程度。在对抗攻击中,攻击者试图通过模型的回复推断出目标属性,而模型的回复可能泄露关键信息。该论文通过信息论方法,将攻击者与模型之间的交互视为信息通道,以观测信号与目标属性之间的互信息来衡量每次查询泄露的信息量。研究结果表明,攻击所需的查询次数与单次查询泄露的信息量呈反比关系,这一发现为评估LLMs的安全性和透明度提供了理论依据。
该论文的实验部分涵盖了七种不同的LLMs,包括GPT-4、DeepSeek-R1、OLMo-2系列和Llama-4系列模型。研究团队针对系统提示泄露、越狱攻击和再学习攻击三种场景进行了实验,验证了理论框架的有效性。实验结果显示,仅暴露答案标记需要约一千次查询,而添加概率信息可将查询次数减少到约一百次,完全暴露思考过程则进一步减少到几十次。这些结果表明,即使是少量的信息泄露,也会显著降低攻击成本。
该论文还探讨了如何通过调整模型的输出多样性来控制信息泄露。研究发现,降低输出的熵(即减少随机性)可以减少信息泄露,但会显著增加攻击所需的查询次数。这一发现为平衡LLMs的透明度和安全性提供了实际指导,强调了在设计和部署LLMs时需要权衡透明度与安全风险。
#大语言模型 #人工智能 #大模型 #LLM #AI #论文 #学术 #NeurIPS #科研 #大模型安全
该论文的实验部分涵盖了七种不同的LLMs,包括GPT-4、DeepSeek-R1、OLMo-2系列和Llama-4系列模型。研究团队针对系统提示泄露、越狱攻击和再学习攻击三种场景进行了实验,验证了理论框架的有效性。实验结果显示,仅暴露答案标记需要约一千次查询,而添加概率信息可将查询次数减少到约一百次,完全暴露思考过程则进一步减少到几十次。这些结果表明,即使是少量的信息泄露,也会显著降低攻击成本。
该论文还探讨了如何通过调整模型的输出多样性来控制信息泄露。研究发现,降低输出的熵(即减少随机性)可以减少信息泄露,但会显著增加攻击所需的查询次数。这一发现为平衡LLMs的透明度和安全性提供了实际指导,强调了在设计和部署LLMs时需要权衡透明度与安全风险。
#大语言模型 #人工智能 #大模型 #LLM #AI #论文 #学术 #NeurIPS #科研 #大模型安全


