推广 热搜: 采购方式  滤芯  带式称重给煤机  甲带  气动隔膜泵  减速机型号  无级变速机  链式给煤机  履带  减速机 

【年度报告】大模型时代的视频与图像安全研究进展 | CSIG视频图像与安全专委会

   日期:2026-08-21 19:26:38     来源:网络整理    作者:本站编辑    评论:0    
【年度报告】大模型时代的视频与图像安全研究进展 | CSIG视频图像与安全专委会
图像与视频是人工智能感知世界、理解场景和生成内容的核心模态。随着多模态大模型和生成式人工智能快速发展,视觉智能正在从“感知”走向“理解”,从“内容分析”走向“内容生成”。以视觉—语言预训练模型和扩散生成模型为代表的新一代人工智能体系,显著推动了智能安防、内容生产、工业检测和公共治理等应用场景的发展。
与此同时,视觉智能能力的快速扩张也带来了新的安全风险:在理解层面,模型在复杂环境、开放场景和弱监督条件下仍可能出现误判、偏差和鲁棒性不足;在生成层面,高保真合成图像与视频可能被用于深度伪造、虚假信息传播、隐私侵犯和身份冒用,对社会信任与公共安全构成挑战。
CSIG视频图像与安全专业委员会组织,由华中科技大学、中国科学院自动化研究所、北京交通大学、北京市科学技术研究院等单位作者合作撰写的综述论文《大模型时代的视频与图像安全研究进展》在《中国图象图形学报》2026年6期出版。论文从图像与视频理解安全和图像与视频生成安全两条主线出发,系统梳理大模型时代视频与图像安全的关键问题、代表方法、应用挑战与发展趋势,为视觉智能安全研究、可信系统建设和生成式内容治理提供重要参考。
“图像图形学发展年度报告”综述专刊

关注学会公众号,回复【年度报告2026】,即可获取综述专刊PDF。

论文信息

大模型时代的视频与图像安全研究进展

引用格式桑农,黄凯奇,赵耀,高常鑫,考月英,谭创创,王翔,武美奇,尹文体. 2026. 大模型时代的视频与图像安全研究进展. 中国图象图形学报,31(6):2222-2259

Sang Nong,Huang Kaiqi,Zhao Yao,Gao Changxin,Kao Yueying, Tan Chuangchuang,Wang Xiang,Wu Meiqi,Yin Wenti. 2026. Advances in video and image security research in the era of large models. Journal of Image and Graphics,31(6):2222-2259 

DOI:10.11834/jig.250656

阅读全文:

http://www.cjig.cn/zh/article/doi/10.11834/jig.250626/

论文看点

图 1 论文总体架构与内容组织

论文面向多模态大模型与生成式人工智能快速发展的技术背景,围绕视频与图像安全建立了较为完整的研究框架。论文总体内容包括图像与视频理解安全、图像与视频生成安全、国内外研究进展比较、发展趋势与展望等部分。

1. 两条主线:理解安全与生成安全

大模型时代的视频与图像安全可从两条主线展开:

  • 图像与视频理解安全:关注视觉模型在异常检测、违规内容识别、开放场景理解、跨模态推理等任务中的可靠性、鲁棒性、可信性与合规性。

  • 图像与视频生成安全:关注生成式模型带来的内容真实性、深度伪造、虚假信息传播、隐私侵犯、可追溯治理等问题。

这一划分将“模型如何理解真实世界”和“模型如何生成视觉内容”置于统一安全框架中,有助于研究者系统把握大模型时代视觉安全的关键问题。

2. 理解安全:异常检测走向开放世界与可解释推理

图 2 基于监督信号分类的视频异常检测方法

在图像与视频理解安全方面,异常检测是核心任务之一。论文按照监督信号将现有异常检测方法归纳为全监督、半监督、弱监督和无监督4类,并总结了各类方法的代表性工作、核心机制与适用场景。

传统异常检测多依赖标注数据、重建误差或统计偏差,而真实场景中的异常往往样本稀少、形态复杂、类别开放。随着视觉—语言大模型的发展,异常检测正在进入新的研究阶段。

图 3 基于大模型的异常检测研究

论文进一步梳理了基于大模型的异常检测研究,包括:

  • 零样本与小样本异常检测:利用视觉—语言预训练模型的泛化能力,降低对大量标注数据的依赖;

  • 开放词汇异常检测:支持模型识别训练阶段未见过、可由自然语言描述的异常类型;

  • 可解释异常检测:从检测到异常进一步走向说明异常原因,增强模型透明度与可信度。

这些研究表明,异常检测正在从传统模式识别走向语义推理和开放世界理解。

3. 生成安全:从图像生成、视频生成到可信治理

图 4 图像生成方法

图 5 视频生成方法

在视频生成方面,论文系统梳理了基于GAN的视频生成、基于扩散模型的视频生成以及多范式融合方法。与图像生成相比,视频生成还需要解决时序一致性、空间连贯性、多模态同步、行为逻辑和长时序语义一致等问题。

论文指出,Sora、Open-Sora、Wan、HunyuanVideo、CogVideoX等大规模视频生成模型的出现,推动视频生成从视觉合成迈向多模态世界建模。与此同时,高保真生成内容也对深度伪造检测、内容溯源和安全监管提出更高要求。

4. 深度伪造检测:从判断真假到解释证据

图 6 人脸伪造检测方法

在人脸伪造检测方面,论文从时空信息、频域信息和可解释检测3个层面进行梳理。相关方法分别关注混合边界、几何约束、帧间不一致、频谱异常、上采样伪影以及多模态大模型驱动的自然语言解释等线索。

图 7 AIGC图像视频伪造检测方法

在AIGC图像视频伪造检测方面,论文进一步总结了基于空间信息、频域信息和可解释检测的技术路线。当前研究不仅关注检测准确率,也越来越重视伪造区域定位、伪造原因分析和可供人工复核的解释输出。

这意味着深度伪造检测正在从判断真假走向定位哪里假、解释为什么假、支撑内容治理决策。

挑战与展望

论文认为,大模型时代的视频与图像安全仍面临以下关键挑战:

大规模、多模态基准亟需建设传统异常检测数据集场景相对有限,未来需要融合视觉、语音、深度、热成像等多模态信息,支撑复杂开放场景下的安全研究。

开放世界异常检测仍需突破现实中的异常类型不断变化,模型需要识别未知异常、适应概念漂移,并在长期运行中保持稳定性能。

生成内容安全治理更加重要未来生成模型需要从“高质量生成”迈向“安全可信生成”,在模型、数据和内容层面建立隐私保护、版权溯源、数字水印和真实性验证机制。

深度伪造检测需要更强泛化与解释能力随着生成模型不断升级,检测方法需要跨模型、跨域、跨模态泛化,并提供更清晰的证据链和可解释结果。

技术、工程与治理机制需协同发展视频与图像安全不只是算法问题,还涉及平台责任、法律伦理、标准规范与社会信任建设。

总体来看,大模型时代的视频与图像安全研究正在从单点检测走向系统治理,从特征判别走向语义推理,从模型性能走向可信、可控、可解释的综合安全体系。

作者简介

桑农华中科技大学教授,中国图像图形学会理事,主要研究方向为模式识别和计算机视觉。

E-mail:nsang@hust.edu.cn

黄凯奇中国科学院自动化研究所研究员,中国图像图形学会理事,主要研究方向为计算机视觉、模式识别、博弈决策。

E-mail:kqhuang@nlpr.ia.ac.cn

赵耀北京交通大学教授,中国图像图形学会常务理事,主要研究方向为计算机视觉、AIGC鉴伪、AI视频编码、多媒体智能理解。

E-mail:yzhao@bjtu.edu.cn

高常鑫华中科技大学教授,主要研究方向为图像/视频理解与生成、多智能体协同。

E-mail:cgao@hust.edu.cn

考月英北京市科学技术研究院高级工程师,主要研究方向为计算机视觉和模式识别。

E-mail:kaoyueying@bjast.ac.cn

谭创创北京交通大学讲师,主要研究方向为计算机视觉、深度伪造检测。

E-mail:tanchuangchuang@bjtu.edu.cn

王翔华中科技大学博士研究生,主要研究方向为视频行为分析、视频生成。

E-mail:wxiang@hust.edu.cn

武美奇中国科学院自动化研究所博士研究生,主要研究方向为计算机视觉、视频生成和手势交互。

E-mail:wumeiqi18@mails.ucas.ac.cn

尹文体华中科技大学硕士研究生,主要研究方向为视频异常检测。

E-mail:yinwt@hust.edu.cn

CSIG视频图像与安全专委会

视频图像与安全是指视频和图像的认知理解、内容安全、泛化通用和数据安全,特别是当前多模态大模型的思维能力、边界局限、幻觉和安全问题。视频图像与安全专委会成立于2017年6月。专委会致力于为视频图像与安全领域的研究人员、专家学者和企业技术人员提供一个交流平台,通过该平台汇聚对该领域感兴趣的研究者和应用者,使得大家能够研究、探讨、交流各自技术和知识,共同探索视频图像与安全领域未来的发展。

专委会负责人信息

主任:

黄凯奇 中国科学院自动化研究所

副主任:

王生进 清华大学

谢剑斌 国防科学技术大学

孙建德 山东师范大学

梁敏学 北京欣博电子科技有限公司

秘书长:

考月英 北京市科学技术研究院

专委会联系人及联系方式

考月英  kaoyueying@bjast.ac.cn

【重要通知】中国图像图形学会2026年度奖励和激励计划推荐工作进行中
【ICIG 2026】注册通道开启,早鸟截至8月31日!提前注册享优惠~
【ICIG 2026】Call for Industry Partners
【征集令】CSIG云讲堂讲者招募启动!云端传智,赋能青年学者共探图像图形前沿
关于征集CSIG图像图形学科前沿讲习班承办方的通知
图像图形领域高质量科技期刊分级目录
中国图像图形学会关于征集科研成果的通知
关于开展中国图像图形学会科技成果鉴定工作的通知
中国图像图形学会科普活动、素材征集通知
 
打赏
 
更多>同类资讯
0相关评论

推荐图文
推荐资讯
点击排行
网站首页  |  关于我们  |  联系方式  |  使用协议  |  版权隐私  |  网站地图  |  排名推广  |  广告服务  |  积分换礼  |  网站留言  |  RSS订阅  |  违规举报  |  皖ICP备20008329号-18
Powered By DESTOON