推广 热搜: 采购方式  滤芯  带式称重给煤机  甲带  气动隔膜泵  减速机型号  无级变速机  链式给煤机  履带  减速机 

NeurIPS 2025 | LLMs对抗攻击信息泄露研究

   日期:2025-11-17 11:48:20     来源:网络整理    作者:本站编辑    评论:0    
NeurIPS 2025 | LLMs对抗攻击信息泄露研究

NeurIPS 2025 | LLMs对抗攻击信息泄露研究

该论文聚焦于大语言模型(LLMs)面临的对抗攻击问题,提出了一种信息论框架来量化攻击中信息泄露的程度。在对抗攻击中,攻击者试图通过模型的回复推断出目标属性,而模型的回复可能泄露关键信息。该论文通过信息论方法,将攻击者与模型之间的交互视为信息通道,以观测信号与目标属性之间的互信息来衡量每次查询泄露的信息量。研究结果表明,攻击所需的查询次数与单次查询泄露的信息量呈反比关系,这一发现为评估LLMs的安全性和透明度提供了理论依据。

该论文的实验部分涵盖了七种不同的LLMs,包括GPT-4、DeepSeek-R1、OLMo-2系列和Llama-4系列模型。研究团队针对系统提示泄露、越狱攻击和再学习攻击三种场景进行了实验,验证了理论框架的有效性。实验结果显示,仅暴露答案标记需要约一千次查询,而添加概率信息可将查询次数减少到约一百次,完全暴露思考过程则进一步减少到几十次。这些结果表明,即使是少量的信息泄露,也会显著降低攻击成本。

该论文还探讨了如何通过调整模型的输出多样性来控制信息泄露。研究发现,降低输出的熵(即减少随机性)可以减少信息泄露,但会显著增加攻击所需的查询次数。这一发现为平衡LLMs的透明度和安全性提供了实际指导,强调了在设计和部署LLMs时需要权衡透明度与安全风险。

#大语言模型 #人工智能 #大模型 #LLM #AI #论文 #学术 #NeurIPS #科研 #大模型安全
 
打赏
 
更多>同类资讯
0相关评论

推荐图文
推荐资讯
点击排行
网站首页  |  关于我们  |  联系方式  |  使用协议  |  版权隐私  |  网站地图  |  排名推广  |  广告服务  |  积分换礼  |  网站留言  |  RSS订阅  |  违规举报  |  皖ICP备20008326号-18
Powered By DESTOON