资讯动态

什么是多模态?多模态大模型综述,看这一篇就够了

发布时间:2026/8/23 19:13:01 来源:尧图企业网站定制
什么是多模态多模态大模型综述看这一篇就够了多模态大型语言模型Multimodal Large Language Models MLLM的出现是建立在大型语言模型Large Language Models LLM和大型视觉模型Large Vision Models LVM领域不断突破的基础上的。随着 LLM 在语言理解和推理能力上的逐步增强指令微调、上下文学习和思维链工具的应用愈加广泛。然而尽管 LLM 在处理语言任务时表现出色但在感知和理解图像等视觉信息方面仍然存在明显的短板。与此同时LVM 在视觉任务如图像分割和目标检测上取得了显著进展通过语言指令已能够引导模型执行这些任务但推理能力仍有待提升。MMLM 的基本结构预训练的多模态编码器1. 模态编码器的功能与选择模态编码器在 MLLM 中承担着将原始的多模态信息如图像或音频转换为紧凑表示的关键角色。与从零开始训练编码器相比常见的做法是采用已经预训练的编码器尤其是那些在大规模图像-文本对上预训练过的模型。例如CLIP 的视觉编码器部分就是一个经典的选择其能够将图像信息有效转化为向量表示并与文本信息对齐。不同的模型在编码器的选择和优化上各有侧重。EVA-CLIP 编码器MiniGPT-4 采用了 EVA-CLIP 编码器这种编码器在性能上优于标准的 CLIP同时所需的训练成本更低。这主要归功于以下三个改进首先EVA-CLIP 通过使用 EVA 模型的预训练权重来初始化图像编码器从而提升了起始性能其次使用了 LAMB 优化器这种优化器特别适用于大批量训练能够通过自适应元素级更新和层级学习率来提高训练效率并加速模型的收敛最后采用了 FLIP 技术在训练过程中随机遮蔽 50%的图像标记从而大幅度减少了时间复杂度使得批量大小可以增加一倍而无需额外的内存开销。此外EVA 模型还通过一种名为 Mask Image Modeling 的任务在更大数据集上进行了训练它将遮蔽部分的图像与 CLIP 模型对应位置的输出进行比对从而在保持语义学习的同时也能让模型学习到几何结构。EVA 的这种训练方式证明了其能够有效扩展模型参数至十亿量级并在广泛的下游任务中展现出色的性能。基于卷积的 ConvNext-L 编码器Osprey 选择了基于卷积的 ConvNext-L 编码器这种编码器能够利用更高分辨率和多层次特征特别是在开放词汇分割任务中展现了较高的效率。在原文中提到Osprey 是基于像素级别的任务如果直接使用 ViT 模型作为编码器会受到计算负担的限制图片大小通常只支持 224 或 336。而基于 CNN 的编码器能够在支持高分辨率的同时保持较高的训练效率和推理速度而不会牺牲性能。无编码器的架构Fuyu-8b 就是采用了纯解码器转换器图像块被线性投影到转换器的第一层绕过了嵌入查找的过程将普通 Transformer 解码器视为图像转换器。这样的设计使得 Fuyu-8b 对灵活输入的分辨率具有强大的适应性。2.模态编码器的优化策略在选择多模态编码器时研究人员通常会考虑分辨率、参数规模和预训练语料库等因素。研究表明使用更高分辨率的图像输入能够显著提升模型的表现。为了实现这一点不同的模型采用了多种策略来优化编码器。直接缩放输入分辨率Qwen-VL 和 LLaVA-1.5 都通过将图像分割成更小的图像块来提高模型的输入分辨率。具体而言LLaVA-1.5 使用了 CLIPViT-L-336px 编码器并发现高分辨率能够提升模型性能。为了进一步优化该模型将图像分割成视觉编码器原本训练时分辨率的小图像块并分别对其进行编码然后将这些特征图组合成一个大特征图最终输入到 LLM 中。这种方式不仅保留了高分辨率的细节还通过降采样图像的特征与合并后的特征图相结合提供了全局上下文从而提高了模型对任意分辨率输入的适应性。CogAgent 采取了双编码器机制来处理高分辨率和低分辨率图像。高分辨率特征通过交叉注意力注入到低分辨率分支中从而在保证效率的同时增强了模型对高分辨率输入的支持。CogAgent 允许输入 1120×1120 分辨率的图像而不需要对视觉语言模型的其他部分做出调整只需对高分辨率交叉模块进行预训练即可。这种方法在 DOC-VQA 和 TEXT-VQA 等任务中显著超越了 LLAVA-1.5 和 Qwen-VL特别是在处理小文字时表现出色。分块法Monkey 和 SPHINX 将大图像分割成小块再将这些子图像与降采样的高分辨率图像一起输入图像编码器。Monkey 支持 1344×896 的分辨率输入通过将大图像分为 6 个 448×448 的图片块再输入到 VIT 模型中。相比之下SPHINX 使用混合视觉编码器将高分辨率的图片分块并与低分辨率全图一起进行编码从而捕获图像的局部和全局特征。预训练的 LLM大多数多模态大型语言模型MLLMs中的语言模型部分通常采用 Causal Decoder 架构遵循如 GPT-3 这样的设计模式。Flan-T5 系列是较早应用于 MLLM 的 LLMs 之一曾在 BLIP-2 和 InstructBLIP 等工作中使用。开源的 LLaMA 系列和 Vicuna 系列则是当前较为常用的 LLMs。在中文环境中Qwen 系列以其中英双语支持而著称广泛应用于多语言场景。扩大 LLMs 的参数规模通常能够带来显著的性能提升。这种效果在 LLaVa-1.5 和 LLava-Next 的研究中得到了验证仅仅将 LLM 的参数规模从 7B 增加到 13B模型在多个基准测试中就获得了全面改进。当 LLM 的参数规模达到 34B 时尽管训练数据主要为英语多模态数据模型仍然展现出新兴的零样本中文能力这表明参数规模的扩大能够增强模型的多语言处理能力。与此同时一些研究也致力于开发轻量化的 LLMs以便在移动设备上实现高效部署。例如MobileVLM 系列使用了缩小版的 LLaMAMobileLLaMA 1.4B/2.7B在移动处理器上实现了高效推理。最近混合专家Mixture of ExpertsMoE架构的研究引起了越来越多的关注。与密集模型不同稀疏架构通过选择性激活参数能够在不增加计算成本的情况下扩大模型的总参数规模。实验证明MM1 和 MoE-LLaVA 在几乎所有基准测试中都比对应的密集模型取得了更优异的性能这表明 MoE 架构在多模态任务中具有显著的潜力。模态接口由于多模态模型的端到端训练难度和成本较高目前大多数模型都采用了基于模态对齐的两种常用方法一是构造可学习的连接器Learnable Connector二是利用专家模型将图像信息转换为语言形式再输入到 LLM 中。这两种方法都旨在缩小不同模态之间的差距使得模型能够更好地理解和处理多模态输入。模态对齐的方法有很多种下面总结常见的 3 种Token 级融合通过将编码器输出的特征转换为 token并在发送给 LLM 之前与文本 token 连接在一起。例如BLIP-2 首次实现了这种基于查询的 token 提取方式随后 Vedio-llama、InstructBLIP 和 X-llm 等模型继承了这一方法。这种 Q-Former 风格的方法将视觉 token 压缩成更少数量的表示向量从而简化了信息的传递和处理过程。相比之下另一种更简单的方法是通过 MLP 接口来弥合模态差距。例如LLaVA、PMC-VQA用于医学图像问答、Pandagpt 和 Detgpt 等模型采用了一个或两个线性 MLP 来投影视觉 token并使其特征维度与词嵌入对齐。这种方法虽然简单但在特定任务上仍能表现出色。特征级融合特征级融合则在文本和视觉特征之间引入了更深度的交互。例如Flamingo 通过在 LLM 的 Transformer 层之间插入额外的交叉注意力层从而用外部视觉线索增强语言特征。类似地CogVLM 通过在每个 Transformer 层中插入视觉专家模块实现了视觉和语言特征的双向交互与融合。有关连接器设计的研究表明token 级融合中模态适配器的类型不如视觉 token 的数量和输入分辨率重要。在视觉问答VQA任务中token 级融合通常表现优于特征级融合。尽管交叉注意力模型可能需要更复杂的超参数搜索过程才能达到相似的性能但 token 级融合的简洁性和高效性使其成为许多 MLLM 模型的首选。就参数规模而言可学习接口通常只占 MLLM 总参数中的一小部分。以 Qwen-VL 为例其 Q-Former 模块的参数规模约为 0.08B仅占总参数的不到 1%而编码器和 LLM 分别占 19.8%1.9B和 80.2%7.7B。因此尽管这些接口模块较小但它们在模态对齐和特征融合中扮演了至关重要的角色。使用专家模型Expert Models融合在多模态模型中专家模型被广泛应用于模态对齐的任务中特别是当需要将图像或其他非语言模态的输入转换为语言形式时。这类方法的核心思想是利用现有的强大模型进行模态转换从而避免重新训练一个复杂的多模态对齐模块。例如Woodpecker、ChatCaptioner、Caption Anything 和 Img2LLM 等模型都依赖于专家模型来完成从图像到语言的转换。这些模型通常通过预训练的图像描述生成器如 BLIP-2将视觉输入转换为文本描述再将其传递给 LLM 进行进一步的处理和生成。这种方法的优势在于可以快速集成和应用现有的模型能力而不需要进行额外的训练或微调。然而尽管这种方法有效且简便但在信息传递的过程中存在信息损失的风险。这是因为每次转换都会不可避免地丢失部分细节和上下文导致最终生成的结果可能偏离原始的多模态输入。未来的研究方向很可能会集中在如何减少这种信息损失特别是在提高模态对齐的精度和可靠性方面。举例来说VideoChat-Text 使用了一个预训练的视觉模型来获取图像中的信息如动作然后通过一个语音识别模型丰富对图像的描述。这种方法虽然能够快速实现多模态的对齐但在多次转换和传递过程中信息的精确度可能会受到影响。因此尽管专家模型的方法在当前阶段非常有效但在高精度和高复杂度任务中仍然有改进的空间。MMLM 的训练策略和训练数据在多模态大型语言模型MLLMs的开发过程中训练策略和数据处理方法对于模型的性能提升至关重要。通常训练分为三个主要阶段预训练指令微调和对齐微调。1. 预训练预训练的主要目标是对齐不同模态同时让模型学习多模态世界中的丰富知识。这个阶段通常需要大规模的文本配对数据如图像-文本对、音频-文本对这些数据能够为模型提供广泛的上下文和世界知识。在预训练过程中常见的输入格式是将一段描述性文本与对应的图像、音频或视频配对通过交叉熵损失函数进行训练。这种方式确保了模型能够在不同模态之间建立有效的关联。预训练的方法通常有两种一种是冻结 LLMs 和视觉编码器只训练模态接口这样可以保留模型已有的预训练知识代表性的模型有 LLaVA、LLaVA-med 和 Detgpt另一种是开放视觉编码器的参数在对齐过程中有更多地参数可以进行微调训练这类方法通常在需要更精确对齐的任务中使用代表性模型有 Qwen-VL、mPLUG-Owl 和 VisionLLM。对于训练数据的处理不同数据集的质量直接影响到模型的训练效果。低质量的数据集如噪声较大的、简短的描述通常使用低分辨率如 224的图像进行训练以加快模型的训练进程而高质量的数据集如较长且干净的描述则推荐使用高分辨率如 448 或以上的图像进行训练以减少“幻觉”现象即模型生成与实际输入不符的内容。例如ShareGPT4V 的研究发现在预训练阶段使用高质量的图像标题数据并且解锁视觉编码器的参数能够显著提高模型对齐的效果。2. 指令微调Instruction-tuning指令微调是训练 MLLMs 的另一关键阶段其目的是让模型更好地理解和执行用户的指令。在这一阶段模型通过学习如何泛化到未见过的任务从而提升零样本的性能。与传统的监督微调相比指令微调更加灵活能够通过适应多任务提示来提高模型的广泛应用能力。这种训练策略在自然语言处理领域已经取得了成功推动了如 ChatGPT、InstructGPT 等模型的发展。2.1 指令微调的数据格式多模态指令样本通常包括一个可选的指令和一个输入-输出对。指令通常是一个描述任务的自然语言句子例如“详细描述这张图像”。输出是基于输入条件下对指令的回答。指令模板是灵活的并且取决于人工设计。需要注意的是指令模板也可以推广到多轮对话的情况。2.2 指令微调的数据收集方式数据收集是训练多模态大型语言模型MLLMs过程中至关重要的一环特别是在指令微调阶段。由于指令数据的格式多样化且任务描述复杂收集这些数据样本通常更具挑战性且成本较高。目前主要有三种方法用于大规模获取指令数据集。数据适配Data Adaptation这种方法利用现有的高质量任务特定数据集并将其转换为指令格式的数据集。例如对于 VQA视觉问答类数据集可以将原始格式图像问题→答案转换为指令格式指令图像问题→答案。许多工作如 MiniGPT-4、LLaVA-med、InstructBLIP、X-LLM、Multi-instruct 和 M3it都是通过这种方式来生成多模态指令数据集。具体而言这些工作通常手动制作一个候选指令池然后在训练时从中采样指令以适应不同的任务需求。自我指令Self-Instruction这种方法通过利用大型语言模型LLMs生成指令数据以应对实际场景中的人类需求。例如LLaVA 采用自我指令方法将图像转换为文本描述和边界框信息然后通过纯文本的 GPT-4 生成新的指令数据最终构建出一个名为 LLaVA-Instruct-150k 的多模态指令数据集。这种方法有效扩展了模型的指令理解能力后续如 MiniGPT-4、ChatBridge、GPT4Tools 和 DetGPT 等工作也基于这一思路开发了适用于不同需求地指令数据集。数据混合Data Mixture除了多模态指令数据之外一些研究还将纯语言的用户助手对话数据整合到训练过程中以提升模型的对话能力和指令遵循能力。例如mPLUG-Owl、Multimodal-gpt 和 LaVIN 直接通过从纯语言和多模态数据中随机采样来构建小批量数据集minibatch。MultiInstruct 则探索了单模态和多模态数据融合的不同策略包括混合指令调优结合两种类型的数据并随机打乱和顺序指令调优先使用文本数据然后是多模态数据从而提高了模型的综合表现。2.3 数据质量数据质量对于模型的训练效果也有显著影响。研究表明在一个高质量的小型微调指令集上进行训练往往比在一个大规模噪声数据集上进行训练效果更好。例如在 Lynx 的研究中发现高质量的数据集应包含丰富多样的提示并涉及更多的推理任务以充分发挥模型的潜力。3. 对齐微调为了提高多模态大型语言模型MLLMs在特定场景下的表现،对齐微调Alignment Tuning是一项不可忽视的关键步骤。对齐微调的目标是减少模型在生成过程中可能出现的“幻觉”现象确保生成内容与输入信息保持一致。在对齐微调中强化学习与人类反馈RLHF和直接偏好优化DPO是两种常见的方法。强化学习与人类反馈RLHFRLHF 是一种通过强化学习算法使模型与人类偏好保持一致的技术它通过监督微调、奖励建模和强化学习三个步骤完成模型的训练。例如InstructGPT 在 RLHF 框架下通过人类标注数据进行监督微调并在训练过程中利用 PPOProximal Policy Optimization算法优化模型的响应质量。直接偏好优化DPODPO 则通过使用简单的二元分类损失从人类偏好标签中学习简化了传统 RLHF 的流程不需要显式的奖励模型从而将整个对齐微调过程简化为人类偏好数据收集和偏好学习两个步骤。在偏好学习中模型需要基于给定的多个“最先掌握AI的人将会比较晚掌握AI的人有竞争优势”。这句话放在计算机、互联网、移动互联网的开局时期都是一样的道理。我在一线互联网企业工作十余年里指导过不少同行后辈。帮助很多人得到了学习和成长。我意识到有很多经验和知识值得分享给大家故此将并将重要的AI大模型资料包括AI大模型入门学习思维导图、精品AI大模型学习书籍手册、视频教程、实战学习等录播视频免费分享出来。【保证100%免费】CSDN粉丝独家福利这份完整版的 AI 大模型学习资料已经上传CSDN朋友们如果需要可以扫描下方二维码点击下方CSDN官方认证链接免费领取【保证100%免费】读者福利CSDN大礼包《最新AI大模型学习资源包》免费分享 安全链接放心点击对于0基础小白入门如果你是零基础小白想快速入门大模型是可以考虑的。一方面是学习时间相对较短学习内容更全面更集中。二方面是可以根据这些资料规划好学习计划和方向。1.大模型入门学习思维导图要学习一门新的技术作为新手一定要先学习成长路线图方向不对努力白费。对于从来没有接触过AI大模型的同学我们帮你准备了详细的学习成长路线图学习规划。可以说是最科学最系统的学习路线大家跟着这个大的方向学习准没问题。全套教程文末领取哈2.AGI大模型配套视频很多朋友都不喜欢晦涩的文字我也为大家准备了视频教程每个章节都是当前板块的精华浓缩。3.大模型实际应用报告合集这套包含640份报告的合集涵盖了AI大模型的理论研究、技术实现、行业应用等多个方面。无论您是科研人员、工程师还是对AI大模型感兴趣的爱好者这套报告合集都将为您提供宝贵的信息和启示。全套教程文末领取哈4.大模型实战项目项目源码光学理论是没用的要学会跟着一起做要动手实操才能将自己的所学运用到实际当中去这时候可以搞点实战项目来学习。全套教程文末领取哈5.大模型经典学习电子书随着人工智能技术的飞速发展AI大模型已经成为了当今科技领域的一大热点。这些大型预训练模型如GPT-3、BERT、XLNet等以其强大的语言理解和生成能力正在改变我们对人工智能的认识。 那以下这些PDF籍就是非常不错的学习资源。全套教程文末领取哈6.大模型面试题答案截至目前大模型已经超过200个在大模型纵横的时代不仅大模型技术越来越卷就连大模型相关的岗位和面试也开始越来越卷了。为了让大家更容易上车大模型算法赛道我总结了大模型常考的面试题。全套教程文末领取哈为什么分享这些资料?只要你是真心想学AI大模型我这份资料就可以无偿分享给你学习我国在这方面的相关人才比较紧缺大模型行业确实也需要更多的有志之士加入进来我也真心希望帮助大家学好这门技术如果日后有什么学习上的问题欢迎找我交流有技术上面的问题我是很愿意去帮助大家的这些资料真的有用吗?这份资料由我和鲁为民博士共同整理鲁为民博士先后获得了北京清华大学学士和美国加州理工学院博士学位在包括IEEE Transactions等学术期刊和诸多国际会议上发表了超过50篇学术论文、取得了多项美国和中国发明专利同时还斩获了吴文俊人工智能科学技术奖。目前我正在和鲁博士共同进行人工智能的研究。资料内容涵盖了从入门到进阶的各类视频教程和实战项目无论你是小白还是有些技术基础的这份资料都绝对能帮助你提升薪资待遇转行大模型岗位。CSDN粉丝独家福利这份完整版的 AI 大模型学习资料已经上传CSDN朋友们如果需要可以扫描下方二维码点击下方CSDN官方认证链接免费领取【保证100%免费】读者福利CSDN大礼包《最新AI大模型学习资源包》免费分享 读者福利CSDN大礼包《最新AI大模型学习资源包》免费分享 读者福利CSDN大礼包《最新AI大模型学习资源包》免费分享 安全链接放心点击

读完文章,也想定制专属网站?

尧图设计师 24 小时内与您沟通定制方案

免费获取报价