多模态学习
什么是多模态学习?常见的多模态任务有哪些?(视觉问答、图文检索、图像描述)¶
多模态学习是指让机器学习模型同时理解和处理来自多种感知模态的信息,例如视觉(图像、视频)、语言(文本)、语音、触觉等,并学习这些模态之间的关联、对齐和互补,以实现更全面、更鲁棒的智能。人类天生是多模态的——我们结合看到的、听到的、读到的信息来理解世界;多模态学习的目标是让机器具备类似的跨模态感知和推理能力。
核心挑战:
-
模态异质性:不同模态的数据结构和统计特性差异巨大,图像是像素网格,文本是离散符号序列,语音是连续波形,如何将它们映射到统一的表示空间是核心难题。
-
对齐与对应:不同模态的信息往往具有细粒度的对应关系,比如图像中的某个区域对应描述中的某个词,视频片段对应语音内容,需要学习这种跨模态对齐。
-
融合与推理:如何有效地融合多模态信息,并在融合的基础上进行推理(如回答涉及视觉和文本的问题)。
-
缺失模态与噪声:在真实场景中,某些模态可能缺失或存在噪声,模型需要具备鲁棒处理能力。
-
大规模数据:多模态数据通常需要大规模的训练语料才能学到有效的联合表示,数据收集和清洗成本高。
常见多模态任务:
-
视觉问答(Visual Question Answering, VQA):给定一张图像和一个关于该图像的自然语言问题,模型需要生成正确的答案。例如,图像中有一群人在公园里,问“有多少人?”,模型需要输出“5”。这要求模型理解图像内容、问题语义,并进行跨模态推理(计数、比较、逻辑推断等)。典型数据集:VQA v2, GQA, OK-VQA(需要外部知识)。
-
图文检索(Image-Text Retrieval):包含两个子任务:以文搜图(给定文本描述,检索相关图像)和以图搜文(给定图像,检索相关描述)。常用于搜索引擎、版权保护等。模型需要将图像和文本映射到同一嵌入空间,使得匹配对的相似度高于非匹配对。典型数据集:Flickr30k, MS-COCO。
-
图像描述(Image Captioning):给定一张图像,自动生成描述图像内容的自然语言句子。需要理解图像中的对象、属性、动作以及它们之间的关系,并将其转化为通顺、准确的语言。典型数据集:MS-COCO Captions, nocaps。评价指标:BLEU, METEOR, CIDEr, SPICE。
-
文本到图像生成(Text-to-Image Generation):给定一段文本描述,生成符合描述的逼真图像。这是近年来的热门任务,代表性模型有 DALL·E 2, Stable Diffusion, Imagen 等。需要将文本语义映射到视觉像素空间,并保证生成图像的质量和一致性。
-
视频-语言任务:
- 视频问答(Video QA):与 VQA 类似,但输入为视频。
- 视频描述(Video Captioning):为视频生成文本描述。
- 视频文本检索(Video-Text Retrieval):根据文本检索视频或根据视频检索文本。
-
时序动作定位(Temporal Action Localization):根据文本查询定位视频中的相应片段。
-
多模态情感分析:结合文本、语音、面部表情等多模态信号分析用户情感,广泛应用于人机交互、心理健康评估。
-
跨模态推理与导航:如具身智能中的视觉-语言导航(VLN),机器人根据语言指令在环境中移动。
-
文档理解与OCR信息抽取:结合图像(扫描文档)、文本(OCR结果)和布局信息,进行关键信息抽取。
-
多模态预训练:在大规模图文、视频文本数据上预训练通用基础模型,然后微调到各类下游任务,如 ViLBERT, UNITER, CLIP, ALBEF, BLIP 系列。
多模态学习正从单任务走向通用多模态基础模型,其目标是建立一个能够同时理解、推理和生成多种模态内容的统一系统。

CLIP 的核心思想是什么?它如何通过对比学习对齐图文?¶
CLIP (Contrastive Language-Image Pre-training) 由 OpenAI 提出,核心思想是利用大规模图文对数据,通过对比学习将图像和文本映射到同一嵌入空间,使得匹配的图文对具有更高的相似度。这完全颠覆了传统视觉模型固定类别标签的有监督训练方式,赋予了模型零样本迁移能力。
训练方式:

对比损失:
计算所有可能的 N×N 个图文对之间的余弦相似度,形成一个相似度矩阵。学习目标为最大化正确配对(对角线元素)的相似度,同时最小化错误配对(非对角线元素)的相似度。损失函数采用对称的 InfoNCE 损失:

其中 τ 为可学习的温度参数。通过这个损失,图像和文本编码器被联合优化,从而对齐两种模态。
为何有效:
-
大规模数据:海量图文对覆盖了丰富的视觉概念和语言表达,模型学会捕捉广义的视觉语义对应。
-
自然语言监督:文本提供了远丰富于固定类别标签的监督信号,携带细粒度语义、属性和关系。
-
对比学习:实例级别的判别任务促使模型学习到高度区分的多模态特征,使同一概念的图文表示靠近,不同概念的表示远离。
CLIP 训练完成后,可以直接用于零样本分类、跨模态检索等任务,而不需任何特定任务的微调,展现了强大的泛化性。
CLIP 的零样本分类是如何实现的?用 prompt 构造分类器。¶
CLIP 的零样本分类是其最具突破性的能力之一:无需在特定分类数据集上训练,仅利用类别名称的自然语言描述即可进行图像分类。
实现原理:
预训练后,CLIP 的图像编码器和文本编码器处于同一个对齐的嵌入空间。对于任意一张图像,我们可以计算它与任意文本描述的相似度。零样本分类正是利用这一属性,将分类转化为图文匹配问题。
步骤:

Prompt 构造的影响:
-
简单的类别名称可能导致歧义或不完整匹配。例如,分类 ImageNet 中的 "crane" 时,可能被理解为“起重机”而非“鹤”。通过 prompt "a photo of a crane bird" 可消除歧义。
-
Prompt engineering(如 CLIP 论文中使用的 80 个上下文模板集成)显著提升了零样本准确率,甚至可以超越某些全监督基线。
-
进一步,prompt 可以包含细粒度描述,如 "a sketch of a {}", "a {} in the dark",使模型对不同数据分布更加鲁棒。
优势:
-
完全无需训练数据,即可泛化到任意类别集合。
-
不限制于预定义类别数量,可随时新增类别。
-
对分布偏移(如素描、绘画)具有更强的适应能力,只需调整 prompt 即可,无需重新训练。
零样本分类的广泛应用:
-
开放域分类:如用户输入任意类别名称,模型即时识别。
-
细粒度分类:通过设计包含差异化描述的 prompt,如 "a {} flower" vs "a {} bird" 进行细粒度区分。
-
跨数据集迁移:无需在目标数据集上微调,直接评估。
CLIP 的零样本分类证明了自然语言监督的强大力量,引领了视觉基础模型的新范式。
ViT 与文本 Transformer 如何结合形成多模态模型?典型的架构有哪些?¶
ViT (Vision Transformer) 将图像分割成块 (patches),视为 token 序列输入 Transformer 编码器。文本 Transformer 将单词或子词作为 token 序列。将二者结合形成多模态模型的方法主要分为以下几类:
-
双塔架构(Dual Encoder)
-
图像和文本分别由独立的 Transformer 编码器处理,各自的输出在顶部通过对比损失或相似度计算进行对齐。代表:CLIP。
-
优点:推理高效,图像和文本特征可离线预先提取,支持大规模跨模态检索。
-
缺点:缺乏细粒度的 token 级别交互,对于需要复杂推理的 VQA 等任务能力有限。
-
单塔融合架构(Fusion Encoder)
-
将视觉 token 和文本 token 拼接在一起,输入一个联合 Transformer 编码器,让它们从底层开始就进行充分的交叉注意力交互。代表:ViLBERT, UNITER, Oscar, VinVL。
-
ViLBERT 使用两个并行的 Transformer 流,分别处理视觉和文本,并在特定层引入协同注意力 (co-attention),让两种模态相互关注。UNITER 则直接将两种 token 拼接,用统一的 Transformer 加上模态类型嵌入和掩码预训练。
-
优点:模态间充分融合,适合复杂的多模态推理任务(如 VQA, 视觉蕴含, 视觉推理)。
-
缺点:推理时对于每个图文对都需要重新计算联合编码,无法预先缓存特征,跨模态检索效率低。
-
编码器-解码器架构(Encoder-Decoder)
-
图像编码器(ViT)将图像编码为一系列视觉 token,文本解码器(通常是自回归 Transformer)以这些视觉 token 为条件生成文本。代表:SimVLM, OFA, BLIP。
-
训练目标通常是生成式(如前缀语言建模或多任务统一学习),给定图像和部分文本,预测后续文本。
-
优点:天然支持图像描述、VQA 生成、多模态对话等生成式任务,架构统一。
-
缺点:对于区分性任务(如检索)需额外设计。
-
桥接架构(Perceiver / Resampler)
-
使用一个较小的 Transformer 模块(如 Q-Former 或 Perceiver Resampler)将视觉 token 压缩为固定数量的“抽象视觉 token”,然后将其作为前缀与文本 token 一起输入到一个冻结的大型语言模型 (LLM) 中。代表:BLIP-2, Flamingo, LLaVA 等。
-
这种架构可以利用预训练好的强大 ViT 和 LLM,只需训练中间的桥接模块和少量适配层,极大降低训练成本,同时赋予 LLM 多模态理解能力。
典型架构对比:
(空表)
现代趋势是构建更统一的架构,例如以 LLM 为核心,将多模态信息压缩为 LLM 可理解的 token,实现任意模态的输入和输出。
BLIP-2 的 Q-Former 起了什么作用?如何弥合视觉编码器和 LLM 的模态鸿沟?¶
BLIP-2 是连接视觉基础模型与大型语言模型(LLM)的突破性工作。它通过一种轻量级的查询 Transformer(Querying Transformer, Q-Former)弥合视觉与语言模态之间的鸿沟,使得冻结的视觉编码器和冻结的 LLM 能够协同工作,从而以极低的训练成本获得强大的多模态能力。
Q-Former 的作用:
Q-Former 是一个小型 Transformer,它接收一组可学习的查询向量(queries) 作为输入,并通过交叉注意力与冻结视觉编码器(如 ViT)的输出进行交互。这些查询向量被训练以从图像特征中抽取与语言相关的信息。Q-Former 输出同样数量的视觉查询嵌入,然后通过线性投影输入到 LLM。
架构与训练:
-
Q-Former 内部有两个共享的注意力模块:一个自注意力层处理查询向量,一个交叉注意力层以视觉特征作为键和值。这类似于 DETR 的目标查询机制。
-
BLIP-2 采用两阶段预训练:
- 第一阶段:视觉-语言表示学习,使用图文对数据,通过三种预训练目标联合优化 Q-Former:
- 图文对比学习 (ITC):对 Q-Former 输出的查询嵌入与文本嵌入进行对比对齐,类似 CLIP。
- 基于图像的文本生成 (ITG):将查询嵌入作为条件,训练 Q-Former 内部的文本生成头,预测图像的描述文本。
- 图文匹配 (ITM):一个二分类任务,判断图文是否匹配。
- 第二阶段:视觉-语言生成学习,将 Q-Former 的输出通过一个全连接层投影后,作为前缀(软 prompt)输入到冻结的 LLM 中,训练生成文本(图像描述、VQA 答案等)。仅更新 Q-Former 和投影层的参数,LLM 保持不变。
如何弥合模态鸿沟:
-
查询向量作为信息瓶颈:Q-Former 被强制将视觉特征压缩为固定数量的、富含语言相关信息的抽象 token。这个压缩过程剔除了视觉冗余,提取出 LLM 所需的高层语义概念(如物体、属性、关系等)。
-
两阶段训练:第一阶段对齐视觉和语言嵌入空间,第二阶段将这种对齐翻译为 LLM 可理解的 prompt。这种分步策略使得不需要端到端训练整个巨大模型,避免了对 LLM 的灾难性遗忘。
-
保留 LLM 的能力:因为 LLM 保持冻结,其原有的强大语言生成、推理和知识能力得以完全保留,只需要学习“看见”即可。
-
模块化:可以灵活替换视觉编码器和 LLM,实现多模态能力的热插拔。
效果:BLIP-2 在各种视觉-语言任务(VQA、图像描述、多模态对话)上达到了当时的顶尖水平,且训练参数量远小于端到端训练的多模态大模型,展示了高效桥接范式的巨大潜力。
多模态模型中的“幻觉”问题有哪些表现?如何缓解?¶
多模态幻觉(Hallucination)指模型生成的文本描述或回答中包含与输入视觉内容不一致、矛盾或虚构的信息。这是当前多模态大模型面临的重大挑战,严重影响其可信度和实用性。
主要表现:
-
对象幻觉 (Object Hallucination):描述中提到了图像中不存在的物体。例如,对一张只有猫的图像,生成“一个女人抱着一只猫”。这是最常见和广泛研究的幻觉类型。
-
属性幻觉 (Attribute Hallucination):错误描述物体的颜色、大小、形状、材质等属性。例如,“红色的汽车”实际是蓝色的。
-
关系幻觉 (Relational Hallucination):错误描述物体之间的空间或语义关系。例如,“狗在桌子上”但实际狗在桌子下。
-
数量幻觉 (Count Hallucination):错误报告物体的数量。例如,“三个人”实际有四人。
-
文本延续幻觉:在生成描述时,模型可能根据语言先验“自由发挥”,例如看到“一个人在切”就自动补充“蔬菜”,而图像中可能在切水果。
-
知识引入幻觉:模型在回答问题时,融入了其参数化知识库中的信息,但这些信息与当前图像无关。例如,问图中是否有某名人的特定动作,模型可能仅根据训练文本中的名人信息作答,忽略实际图像。
缓解策略:
数据层面:
-
构建高质量、无偏的图文数据集,减少训练数据中的错误对应。
-
使用专门设计的负样本数据,如构造包含冲突描述的数据进行训练,使模型学会鉴别。
模型架构与训练:
-
增强视觉编码:使用更高分辨率的图像输入、更强大的视觉编码器(如 ViT-G/14),提供更丰富的视觉特征。
-
细粒度对齐:在 token 或 patch 级别进行更精细的对比学习或注意力引导,例如引入目标检测或分割特征来强化对象表征。
-
指令微调与 RLHF:使用指令微调数据,让模型学会“根据图像回答,不知道就说不知道”。通过人类反馈强化学习(RLHF)惩罚幻觉输出。
-
解码策略优化:
- 使用 CFG (Classifier-Free Guidance) 降低语言先验,增强视觉条件的影响。
- 降低生成时的 temperature 以减小随机性。
-
使用视觉对比解码 (VCD) 等方法,通过对比原始分布与扭曲视觉输入的分布来减去语言先验偏差。
-
后处理纠正:利用外部工具或模型进行事实核查。例如,训练一个对象检测器,将生成的描述与检测结果比对,自动过滤或修正不一致的内容。
评价基准:
-
CHAIR (Caption Hallucination Assessment with Image Relevance):测量图像描述中幻觉对象的比例。
-
POPE (Polling-based Object Probing Evaluation):通过构造简单问题询问对象是否存在,评估模型的幻觉率。
-
AMBER:多维度幻觉评估基准。
多模态幻觉的完全消除仍然是一个开放研究问题,需要从数据、模型、推理等多方面综合发力。
在视频-语言模型中,如何处理时序信息?时间注意力或 3D 特征。¶
视频包含丰富的时序动态,处理时序信息是视频理解的核心挑战。视频-语言模型需要将时序变化的视觉信息与语言描述(可能涉及动作、事件顺序等)对齐。主要方法包括:
-
3D 卷积特征
-
使用 3D CNN(如 C3D, I3D, SlowFast)直接从视频片段中提取时空特征。这些网络在空间和时间维度上同时卷积,能够捕捉短时的动作模式和运动信息。
-
优点:特征包含局部运动线索,计算高效(尤其对于短视频片段)。
-
缺点:对长时依赖建模能力有限,感受野受限于卷积核的时间长度;无法灵活处理变长视频。
-
使用方式:通常将 3D 特征作为视觉 token 输入 Transformer,或进行池化后用于对比。
-
时间注意力机制
-
使用 Transformer 模型对由帧级特征组成的序列进行时间建模。常见流程:

- 时间注意力变体:
- 联合时空注意力:将时间和空间维度打平为长序列,让模型同时学习时空交互(如 TimeSformer, ViViT)。虽然计算量大,但建模能力强。
- 分离时空注意力:先空间注意力再时间注意力,减少计算量。
-
轴向注意力:在空间和时间轴上分别使用注意力。
-
优点:能捕获长距离时间依赖,灵活处理变长视频,与 Transformer 架构天然匹配。
-
缺点:当视频很长时,复杂度随帧数平方增长,需采用内存高效设计(如记忆压缩、窗口注意力)。
-
时间特征池化或聚合
-
对帧级特征进行简单的池化(平均、最大池化)或使用 NetVLAD、NeXtVLAD 等聚合方法,得到一个固定维度的全局视频表示。
-
适用于检索等不需要细粒度时序定位的任务。
-
优点:简单快速,可以高效处理任意长度视频。
-
缺点:丢失了时序顺序和细粒度动态信息。
-
结构化表示
-
将视频表示为场景图序列或对象的轨迹,结合图神经网络或序列模型进行推理。这更符号化,适合需要复杂因果推理的任务。
-
视频-语言预训练中的时序建模
-
大量视频-语言模型(如 VideoBERT, ClipBERT, Frozen, VIOLET, InternVideo)将文本与帧/片段特征联合训练。通过掩码帧建模、时间对比损失、帧-文本对齐等目标,使模型理解动作、事件和顺序。例如,使用 TCO (Temporal Contrastive Objective) 鼓励相邻片段比远距离片段更相似,或让模型判断视频片段的先后顺序。
主流趋势:以 Transformer 为基础,结合 3D 编码和时空注意力,利用海量视频文本数据预训练,已成为视频理解的标准范式。对于超长视频,近期工作引入了记忆库、压缩机制和检索增强方法来处理。
跨模态检索的评估通常用什么指标?Recall@K。¶
跨模态检索(如图文检索、视频文检索)的核心任务是给定一个模态的查询(如一段文字),从另一个模态的数据库中检索出与之匹配的候选项(如图片)。由于检索系统返回一个排序列表,最常用的评估指标是Recall@K及其变体。
Recall@K (R@K)
定义为在返回的前 K 个候选项中,包含至少一个正确匹配的概率(或比例)。通常报告 K=1, 5, 10。

例如,R@1 衡量首个结果即命中的比例,反映系统的精确推荐能力;R@10 反映系统在较宽松条件下的查全能力。在跨模态检索中,通常分别报告“图像检索文本”(Image-to-Text R@K)和“文本检索图像”(Text-to-Image R@K),以及它们的平均或总和(有时称作 R@sum,即将所有 R@1, R@5, R@10 加起来作为总体指标)。
其他相关指标:
-
中位秩 (Median Rank):正确结果在排序列表中位置的中位数,越低越好。
-
平均倒数秩 (MRR):所有查询的倒数秩的平均值。只关心第一个正确匹配的位置。
-
Precision@K:前 K 个结果中相关项的比例。在检索中不如 Recall@K 常用,因为通常只有一个或少数几个正确项。
-
nDCG:当检索结果有多个相关等级(如非常相关、部分相关)时使用,但在标准跨模态检索中,一般每个查询只有一个目标匹配,所以更常用 Recall@K。
评估设置:
-
在图文检索数据集(Flickr30k, MS-COCO)中,通常设定测试集包含 1000 或 5000 张图片,计算所有图片与文本之间的相似度矩阵,并取每行/每列的排序。
-
零样本检索:用 CLIP 等在大规模数据上预训练的模型,无需微调,直接测试其在目标数据集上的检索性能,这是当前衡量模型泛化能力的重要方式。
为什么使用 Recall@K?
因为它直接反映了用户在实际使用中的体验:用户在搜索时通常只看前几页结果,关心正确的项目是否被展示在显著位置。它简单、直观,适合评估嵌入空间的质量。
多模态大模型的指令微调数据如何构造?有哪些关键挑战?¶
多模态大模型(如 LLaVA, InstructBLIP, MiniGPT-4)的指令微调(Instruction Tuning)旨在让模型理解和遵循人类指令,完成复杂的多模态任务,并以对话形式回答。其核心是构造高质量的视觉-语言指令数据。
数据构造方法:
- 基于现有数据集转换:
- 将公开数据集(如 VQA、图像描述、Referring Expression)中的标注重新组织为指令-回答对。
- 示例:VQA 的问题可直接作为指令,答案为回答;图像描述数据集可构造为“请详细描述这张图片” → 描述文本。
-
优点:数据量大,易于扩展。缺点:指令形式单一,缺乏多样性,回答风格固定。
-
利用 LLM 生成指令数据:
- 用仅有语言的 GPT-4 或强大 LLM,以图像标注(如对象标签、属性、描述)作为上下文,让 LLM 生成多样化的指令-回答对。
- LLaVA 采用此方法:从 COCO 图像中,将检测到的对象、属性等作为符号化描述,输入到纯文本 GPT-4,要求生成关于该图像的对话、细节描述、复杂推理问题及回答。
-
优点:指令丰富多样,回答自然详细。缺点:依赖文本标注的质量,LLM 可能产生与图像内容不一致的“幻觉”回答。
-
基于真实多模态模型的数据生成:
-
使用已有的较好多模态模型(如 BLIP-2, InstructBLIP)对图像生成响应,然后人工过滤或由 LLM 修订,用于训练更强大的模型。这是自举(bootstrapping)的思想。
-
纯人工编写:
- 聘请标注人员根据图像编写指令和高质量回答。质量最高,但成本高昂,难以大规模。
关键挑战:
-
幻觉与事实一致性:LLM 生成的回答可能包含图像中不存在的信息,这种噪音被训练后会加剧模型的幻觉。需设计过滤和修正机制。
-
指令多样性:如何生成足够多样的指令,覆盖不同类型的用户意图(描述、推理、OCR、创意写作等)。
-
多模态对齐:即使文本生成质量高,若回答与图像的细粒度对齐不足(如指代错误),模型可能学到错误的关联。
-
长尾概念覆盖:罕见物体、场景的指令数据稀缺,易导致模型在这些情况下表现差。
-
评价困难:指令微调后的模型评估缺乏可靠的自动指标,通常需要人工评测或 GPT-4 评分,成本高且难以规模化。
-
多轮对话一致性:构造多轮对话数据,保持上下文连贯且与图像相关,极具挑战。
趋势:结合自动生成和人工精炼的半自动方式,并引入 RLHF/DPO 等对齐技术,不断提升指令数据的质量和模型的事实准确性。
多模态学习的未来趋势:统一的任意模态理解与生成模型。¶
多模态学习的终极目标是构建一个统一的任意模态理解与生成基础模型(Unified Any-to-Any Multimodal Model),能够接受任何模态的组合作为输入,并生成任何模态的输出,并在众多任务中达到甚至超越人类水平。当前趋势正朝这个方向迅速发展:
-
统一架构:Transformer 作为通用骨干
-
将所有模态(文本、图像、视频、音频、代码、3D等)都表示为 token 序列(离散化或连续特征),输入同一个 Transformer 模型。
-
训练目标采用统一的“下一 token 预测”(如 GPT 方式)或扩散/掩码建模,不再需要单独为每个任务设计特定损失。例如 4M, Unified-IO, OFA, GATO 等工作已经朝此方向努力。
-
这种统一性极大地简化了模型设计,并允许知识在不同模态间自然流动。
-
原生多模态生成
-
早期模型多在输入侧多模态,输出仅限于文本。未来的模型将能够同时输出图文交错的内容、生成可编辑的 3D 模型、合成带配乐的视频等。
-
例如,一个模型接收“生成一幅油画风格的猫,并写一段诗”的指令,同时产出图像和文本。
-
连续和离散表示的融合:图像等连续模态常使用 VAE 或扩散模型生成,语言使用离散 token,未来需要在模型内部无缝融合这两种生成范式(如 Unified-IO 2, Chameleon, EMU)。
-
更深度的工具使用与推理
-
模型将学会调用外部工具(搜索引擎、计算器、代码解释器、CAD 软件等)来完成复杂多步任务。
-
结合推理链路(Chain-of-Thought),多模态模型将不仅描述所见,更能进行“视觉推理 + 知识检索 + 工具执行”的闭环。
-
世界模型与具身智能
-
多模态大模型将成为“世界模型”的基石,通过视频、文本和交互数据学习物理规律、因果推理和常识。在机器人等领域,模型直接处理视觉、语言、触觉,输出动作指令,实现通用具身智能。
-
个性化与安全对齐
-
未来的多模态模型将能更好地适应个体用户的偏好,同时在多模态层面进行价值观对齐和安全过滤(避免生成有害图像、隐私泄露等)。多模态 RLHF 和 Red Teaming 将更加重要。
-
计算效率与边缘部署
-
虽然模型越来越大,但通过蒸馏、量化、稀疏化以及架构创新(如 Mamba 状态空间模型)使多模态能力可以在手机、AR眼镜等边缘设备上实时运行,实现真正的普及。
-
持续学习与多语言多文化泛化
-
模型需要持续从多语言、多文化的多模态数据中学习,打破以英文和西方图像为中心的偏见,构建全球化的、包容的智能。
未来十年,多模态学习将从“拼凑专家模块”走向“单一全能基础模型”,成为通用人工智能(AGI)感知世界的核心入口。这一趋势将深刻改变人机交互、内容创作、科学发现和社会生产的方式。