
视觉文本对齐:精细化语义融合
这块现在卷得很凶,但依旧有空间,尤其是fine-grained alignment。比如图中有只猫,文本说的是“懒洋洋的猫躺在沙发上”,你怎么把“懒洋洋”和“猫”精确对齐?可以搞跨模态注意力+区域级特征对齐,或者用CLIP加细粒度分支继续卷,还有不少人做prompt调节+局部区域对齐这块,感觉挺容易搞出点新意。
多模态情绪识别:加入生理信号
原来多模态情绪识别基本上就是图像+文本+语音,现在大家开始往EEG、心率、皮肤电等生理信号扩展。我觉得这个方向属于“冷门但潜力大”,主要瓶颈是数据集,但一旦你有数据,轻轻一搞个GNN或者对比学习框架,投稿AAAI或者ICASSP都挺有希望。
医学多模态:CT+文本+电子病历
医疗这块现在也开始搞多模态了,比如用CT图像+病人主诉文本+检查指标表格一起预测病情发展。这里面就很适合做跨模态图结构建模,图谱+Transformer这种组合用得挺多的。能拿到数据的话,做点医学大模型微调+结构融合,也是目前热门的发文方向。
多模态小样本学习:跨模态增强
多模态+小样本现在也开始结合了,比如只有少量标注图像+大量文本的情况怎么训练一个分类模型?可以尝试用跨模态生成+知识蒸馏的方式做增强,比如先用文生成图、再训练视觉模型,或者用少量样本训练共享编码器,这块顶会还没完全卷起来,有操作空间。
视频理解中的多模态融合:动作识别/事件检测
视频数据本身就包含图像+语音+文本字幕甚至是OCR信息,用这些多模态做长时序事件检测、动作识别很有前景。可以试试分段式Transformer + 跨模态门控机制来建模这种长时依赖的关系,像Ego4D、AVA这种数据集现在也还没被完全榨干,感觉还能再挤一挤。
大家可以拿去试试,希望你们的模型能work,?
#深度学习 #Python #大模型 #多模态人工智能 #创新点实现 #提供思路和创新点 #算法 #论文 #ccf #sci
这块现在卷得很凶,但依旧有空间,尤其是fine-grained alignment。比如图中有只猫,文本说的是“懒洋洋的猫躺在沙发上”,你怎么把“懒洋洋”和“猫”精确对齐?可以搞跨模态注意力+区域级特征对齐,或者用CLIP加细粒度分支继续卷,还有不少人做prompt调节+局部区域对齐这块,感觉挺容易搞出点新意。
多模态情绪识别:加入生理信号
原来多模态情绪识别基本上就是图像+文本+语音,现在大家开始往EEG、心率、皮肤电等生理信号扩展。我觉得这个方向属于“冷门但潜力大”,主要瓶颈是数据集,但一旦你有数据,轻轻一搞个GNN或者对比学习框架,投稿AAAI或者ICASSP都挺有希望。
医学多模态:CT+文本+电子病历
医疗这块现在也开始搞多模态了,比如用CT图像+病人主诉文本+检查指标表格一起预测病情发展。这里面就很适合做跨模态图结构建模,图谱+Transformer这种组合用得挺多的。能拿到数据的话,做点医学大模型微调+结构融合,也是目前热门的发文方向。
多模态小样本学习:跨模态增强
多模态+小样本现在也开始结合了,比如只有少量标注图像+大量文本的情况怎么训练一个分类模型?可以尝试用跨模态生成+知识蒸馏的方式做增强,比如先用文生成图、再训练视觉模型,或者用少量样本训练共享编码器,这块顶会还没完全卷起来,有操作空间。
视频理解中的多模态融合:动作识别/事件检测
视频数据本身就包含图像+语音+文本字幕甚至是OCR信息,用这些多模态做长时序事件检测、动作识别很有前景。可以试试分段式Transformer + 跨模态门控机制来建模这种长时依赖的关系,像Ego4D、AVA这种数据集现在也还没被完全榨干,感觉还能再挤一挤。
大家可以拿去试试,希望你们的模型能work,?
#深度学习 #Python #大模型 #多模态人工智能 #创新点实现 #提供思路和创新点 #算法 #论文 #ccf #sci


