
1. 研究背景与动机
背景:多模态大型语言模型(MLLM)在处理视觉信息时依赖其视觉编码器的感知能力。然而,现有的 MLLM 缺乏自主控制视觉感知过程的能力,例如选择性地回顾图像的特定区域或关注特定对象类别的信息。
动机:为了提高 MLLM 在空间推理、细粒度理解等任务中的性能,作者提出了一种新的机制,使 MLLM 能够自主控制其视觉感知过程。
2. 视觉感知令牌的设计
区域选择令牌(Region Selection Token):用于指示 MLLM 裁剪图像中的特定区域,并重新编码这些区域以提高视觉感知的精度。这些令牌通过指定图像中的特定区域来增强模型对细节的关注。
视觉重新编码令牌(Vision Re-Encoding Token):用于触发额外的视觉编码器(如 DINO 或 SAM)重新编码整个图像,并将生成的视觉特征与原始特征结合,以提供更丰富的视觉信息。
机制:这些令牌被整合到 MLLM 的词汇表中,并可以通过下一个标记预测生成,类似于自然语言生成。
3. 实验与性能提升
实验设置:作者构建了一个包含 829k 个样本的训练数据集,涵盖四种任务类别:通用 VQA、细粒度 VQA、空间推理和文本/OCR 相关 VQA。
性能提升:
在空间推理和细粒度 VQA 任务中,配备视觉感知令牌的 2B 模型分别比 7B 基线模型提高了 34.6% 和 32.7%。
平均而言,视觉感知令牌使 2B 模型的性能提高了 30.9%,使其得分从 0.572 提高到 0.749,甚至超过了 7B 参数模型 20.0%(从 0.624)。
泛化能力:在未参与训练的 Flickr、DUDE 和 POPE 数据集上,2B-VPT 模型也表现出良好的泛化能力。
4. 关键结论
自主控制视觉感知:视觉感知令牌使 MLLM 能够自主选择和重新编码图像中的特定区域,从而显著提升其在视觉问答任务中的性能。
细粒度控制:视觉重新编码令牌通过引入额外的视觉特征和控制信号,进一步增强了模型的视觉感知能力。
泛化能力:该方法不仅在训练数据集上表现出色,还在未见过的数据集上展现了良好的泛化能力。
5. 实验细节与讨论
掩码建模:通过掩码建模和对隐藏状态的额外训练,可以进一步提升视觉重新编码令牌的性能。
与现有方法的对比:与直接预测边界框的方法相比,区域选择令牌在准确性上具有显著优势。#大模型 #人工智能发展 #计算机视觉 #创新点实现
背景:多模态大型语言模型(MLLM)在处理视觉信息时依赖其视觉编码器的感知能力。然而,现有的 MLLM 缺乏自主控制视觉感知过程的能力,例如选择性地回顾图像的特定区域或关注特定对象类别的信息。
动机:为了提高 MLLM 在空间推理、细粒度理解等任务中的性能,作者提出了一种新的机制,使 MLLM 能够自主控制其视觉感知过程。
2. 视觉感知令牌的设计
区域选择令牌(Region Selection Token):用于指示 MLLM 裁剪图像中的特定区域,并重新编码这些区域以提高视觉感知的精度。这些令牌通过指定图像中的特定区域来增强模型对细节的关注。
视觉重新编码令牌(Vision Re-Encoding Token):用于触发额外的视觉编码器(如 DINO 或 SAM)重新编码整个图像,并将生成的视觉特征与原始特征结合,以提供更丰富的视觉信息。
机制:这些令牌被整合到 MLLM 的词汇表中,并可以通过下一个标记预测生成,类似于自然语言生成。
3. 实验与性能提升
实验设置:作者构建了一个包含 829k 个样本的训练数据集,涵盖四种任务类别:通用 VQA、细粒度 VQA、空间推理和文本/OCR 相关 VQA。
性能提升:
在空间推理和细粒度 VQA 任务中,配备视觉感知令牌的 2B 模型分别比 7B 基线模型提高了 34.6% 和 32.7%。
平均而言,视觉感知令牌使 2B 模型的性能提高了 30.9%,使其得分从 0.572 提高到 0.749,甚至超过了 7B 参数模型 20.0%(从 0.624)。
泛化能力:在未参与训练的 Flickr、DUDE 和 POPE 数据集上,2B-VPT 模型也表现出良好的泛化能力。
4. 关键结论
自主控制视觉感知:视觉感知令牌使 MLLM 能够自主选择和重新编码图像中的特定区域,从而显著提升其在视觉问答任务中的性能。
细粒度控制:视觉重新编码令牌通过引入额外的视觉特征和控制信号,进一步增强了模型的视觉感知能力。
泛化能力:该方法不仅在训练数据集上表现出色,还在未见过的数据集上展现了良好的泛化能力。
5. 实验细节与讨论
掩码建模:通过掩码建模和对隐藏状态的额外训练,可以进一步提升视觉重新编码令牌的性能。
与现有方法的对比:与直接预测边界框的方法相比,区域选择令牌在准确性上具有显著优势。#大模型 #人工智能发展 #计算机视觉 #创新点实现


