统一多模态大模型:Any-to-Any架构、离散化、数据与评估全解¶
统一多模态模型的目标是打破模态壁垒,让单一模型能够接受图像、文本、音频、视频等多种输入,并生成相应的输出。以下是针对其核心架构、Token化、训练策略与评估的深度剖析。

实现 Any-to-Any 模型,除了统一 token 化,还需要解决“模态间翻译”的数据稀疏问题,你有什么办法?¶
Any-to-Any模型需要处理所有模态间的映射(文本→图像、图像→音频、音频→文本等),但标注数据严重稀疏:文本-图像对有数亿对,但直接标注的“音频→文本描述”数据少得多,而“深度图→热力图”这样的跨模态配对几乎没有。解决这一问题的核心思路是利用已有丰富数据建立桥梁模态,通过传递性实现所有模态的互联。
策略一:以图像/文本为中心构建模态星型结构
ImageBind证明,将所有模态对齐到图像这一中心模态即可实现间接的任意跨模态检索。在生成任务中,我们可以将这个思想扩展为“枢纽生成”:训练模型在枢纽模态上进行跨模态翻译,然后在枢纽模态上进行二次翻译到达目标模态。例如:
-
若没有“音频→深度图”的配对数据,但存在“音频→图像”和“图像→深度图”的配对数据,则可以通过两阶段生成实现音频到深度图的映射。
-
这要求模型能够执行组合式生成,将多个对齐能力串联起来。在训练时,可以通过随机切断生成链并进行端到端微调来增强这种组合能力。
策略二:循环一致性与伪标签生成
对于完全没有配对数据的模态对(如音频↔深度图),可以利用现有模型生成伪配对数据,然后进行自训练:
-
先用已对齐的模态训练一个基础Any-to-Any模型。
-
对于未配对数据,通过“循环翻译”生成伪标签:将音频生成图像(有监督),再将图像生成深度图(有监督),然后将这条“音频→深度图”的合成链作为弱监督信号进行微调。
-
在生成过程中加入一致性损失:音频→深度图→音频,要求重建的音频与原始音频接近。这种循环一致性约束无需配对的监督,却能保证翻译的质量。
策略三:多任务联合训练与知识共享
将所有模态的编码器和解码器部分共享,使得“翻译”知识的迁移成为可能。即使某个模态对没有直接训练数据,共享的编码器已经从其他任务中学习了该模态的通用表示,共享的解码器也具备了生成该模态的基本能力。这种架构层面的泛化可以通过少样本微调迅速适应新的模态对。
策略四:合成数据与数据增强
利用已有的大规模单模态生成模型(如扩散模型、LLM)为稀缺模态对生成合成训练数据。例如:
-
使用LLM为音频生成文本描述,构建“音频→文本”对。
-
使用文生图模型基于文本描述生成图像,再与原始文本配对,增强“文本→图像”数据。
-
通过图像编辑工具生成多视角、不同光照的深度图,构建“图像→深度图”对。
这些合成数据虽不完美,但可以作为预训练的“填充物”,极大缓解数据稀疏性。
使用 VQ-VAE 将连续模态离散化时,如何选择码本大小?码本坍塌如何解决?¶
VQ-VAE将连续特征映射到离散的码本向量,是统一多模态token化的核心技术。码本大小和码本坍塌是其两大核心挑战。
码本大小选择:
| 模态 | 推荐码本大小 | 理由 |
|---|---|---|
| 图像/视频帧 | 8192~16384 | 视觉细节丰富,需要大码本捕捉纹理、颜色、形状的多样性 |
| 音频(频谱图) | 2048~4096 | 音频模式相对有限,但需要区分不同音色和音调 |
| 深度图 | 512~1024 | 深度信息平滑,模式较为单一 |
| 文本 | 32000~100000 | 语言概念离散且组合性强,需要大词汇量 |
选择原则:
-
码本太小 → 信息压缩过重,重建质量差,无法保留细节。
-
码本太大 → 大量码本向量在训练中从未被使用(码本坍塌),浪费计算和内存,且导致训练不稳定。
-
经验法则:码本大小应为该模态典型数据中可区分“视觉/听觉概念”数量的2-4倍。
码本坍塌的表现与解决:
码本坍塌指训练过程中只有极少数码本向量被使用,大部分码本成为“死向量”,模型表达能力退化。
表现:
-
码本使用率极低(如8192个码本仅使用100个)。
-
重建图像的多样性丧失,无论输入什么图像,输出都趋于平均化。
根本原因:
-
编码器输出的特征向量与码本初始向量的距离过大,导致少数向量“胜者通吃”。
-
优化器的动量使得少数活跃向量更新频繁,而其他向量梯度为零,停滞不前。
解决方法:
| 方法 | 原理 | 效果 |
|---|---|---|
| EMA更新码本 | 使用指数移动平均更新码本向量,而非梯度更新。能够平滑更新,让更多码本参与 | 显著缓解坍塌,但需谨慎设置衰减率 |
| 码本重启 | 定期检测使用频率极低的“死向量”,将其重置为编码器当前输出的随机样本 | 简单有效,但可能导致训练波动 |
| 随机深度/码本Dropout | 在训练中随机mask掉部分码本,强制模型使用其他码本 | 增强码本的利用率 |
| 熵正则化 | 在损失中加入最大化码本使用熵的项,鼓励均匀使用所有码本 | 平衡使用,但需调整权重 |
| 分组码本 | 将一个大码本拆分为多个小组,每组独立量化特征的一个子空间 | 减少码本间的竞争,提高总使用率 |
| 余弦相似度替代欧氏距离 | 使用余弦相似度寻找最近码本,消除向量模长的影响 | 对某些模态更鲁棒 |
最佳实践:推荐使用“EMA更新码本 + 分组码本 + 码本重启”的组合方案。在训练初期用较大的码本(如16384),配合温和的熵正则化;如果检测到使用率低于50%,则触发码本重启。
为什么 ImageBind 选择图像作为桥梁模态来绑定其他模态?这种设计有什么优势?¶
ImageBind以图像为中心,将所有其他模态(文本、音频、深度、热力、IMU)对齐到图像嵌入空间。这种设计并非随意选择,而是基于图像在多模态数据生态中的独特地位。
选择图像的深层原因:
-
图像与其他模态的共现数据最丰富。人类记录世界的主要方式是视觉。互联网上,图像与文本(alt-text)、图像与音频(视频)、图像与深度(RGB-D传感器)、甚至图像与IMU(机器人操作数据)都大量共存。图像是连接所有其他模态的天然枢纽。
-
图像表示具有最高的语义密度。一张图片包含物体、属性、空间关系、场景、文字等极其丰富的信息,是“一图胜千言”的体现。将其他模态对齐到图像空间,意味着将它们与这个高密度的语义空间绑定,从而获得丰富的语义信息。
-
图像嵌入空间已被充分研究且鲁棒。CLIP等大规模图文预训练模型已经建立了高度语义化的图像嵌入空间,具有良好的线性可分性和语义平滑性。将新模态对齐到这个已有空间,可以“搭便车”获得这些优良性质。
设计优势:
| 优势 | 说明 |
|---|---|
| 避免组合爆炸 | 六种模态如果两两对齐,需要训练C(6,2)=15个对齐任务。以图像为中心仅需5个对齐任务,大幅降低训练成本 |
| 传递性对齐 | 即使文本和IMU没有直接成对数据,由于两者都与图像对齐,它们在隐空间中也自然接近。实现了“零样本跨模态检索” |
| 对新模态开放 | 若未来需要加入第七种模态,只需收集该模态与图像的成对数据并训练对齐即可,无需修改已对齐的六种模态。扩展性极强 |
| 语义可解释性 | 所有模态嵌入在同一个空间中,可以直接计算跨模态余弦相似度,可视化t-SNE可直观看到模态间的语义聚类 |
潜在局限:某些模态与图像的信息重叠度低(如纯时序信号IMU),强制对齐到图像空间可能丢失其特有信息。未来可能需要多个桥梁模态(图像+文本)来更全面地覆盖模态特性。
统一多模态模型是否一定要共享所有参数?是否可以有模态专用参数和共享参数混合?¶
不需要,且实践证明,完全的参数共享往往不是最优解。不同模态的低级特征提取需求差异巨大(如像素处理 vs 声波处理),而高层语义推理又可以共享。混合参数架构是目前更灵活有效的方案。
混合参数架构设计:
| 参数类型 | 范围 | 作用 | 示例 |
|---|---|---|---|
| 模态专用参数 | 浅层特征提取 | 处理模态特定的低级信号(解码、分块、初始嵌入) | 图像卷积stem、音频频谱图投影、文本嵌入层 |
| 共享参数 | 深层Transformer | 跨模态语义理解、推理、对齐、生成 | 统一的Transformer骨干网络 |
| 半共享参数 | 中间层 | 通过适配器或专家混合实现条件化的共享 | MoE中的模态专家、Adapter模块 |
三种混合策略:
-
共享骨干 + 模态专用头部:绝大多数参数在共享Transformer中,仅在输入端有轻量的模态特定编码器,输出端有模态特定解码器。这是目前主流方案(如Gemini、GPT-4o)的隐含设计。
-
MoE模式:Transformer中的FFN层采用专家混合。部分专家是模态专用的(如图像专家、音频专家),部分专家是跨模态共享的。路由机制根据输入token的模态类型和内容动态选择专家。这既保证了模态特定的处理能力,又保留了跨模态知识共享。
-
Adapter插入:在共享Transformer的每一层插入轻量的模态专用Adapter模块(如LoRA)。共享参数保持冻结,仅训练Adapter。这使得同一个模型可以通过加载不同的Adapter权重来适配不同模态。
实践建议:
-
对于资源充足的场景,采用MoE方案可获得最佳性能。
-
对于需要灵活部署的场景,Adapter方案允许一个基础模型衍生出多个模态变体。
-
模态专用参数的比例通常控制在总参数的5%-20%之间,以确保充分的跨模态知识迁移。
多模态 MoE:是否可以为不同模态设置不同的专家网络,并在推理时动态路由?¶
完全可以,多模态MoE正是当前最前沿的统一多模态模型架构之一。它将“模态特定处理”和“跨模态共享”通过专家路由优雅地统一起来。
架构设计:

路由策略:
| 路由方式 | 实现 | 适用场景 |
|---|---|---|
| 硬性模态路由 | 根据token的模态类型,强制路由到对应专家。图像token→图像专家,文本token→文本专家 | 模态差异大,不希望干扰 |
| 软性内容路由 | 由门控网络根据token的内容特征决定专家权重。图像中的文字区域可能被路由到文本专家 | 需要跨模态融合 |
| 混合路由 | 结合模态类型嵌入和内容特征,同时允许路由到模态专用和共享专家 | 当前最优方案 |
动态路由的优势:
-
计算效率:每个token仅激活少数专家(Top-K路由),总计算量远低于激活整个FFN。在推理时,可以通过专家并行分布到多GPU。
-
模态间知识迁移:共享专家捕获所有模态的通用模式,模态专用专家捕获特定特征。当某个模态数据稀疏时,其专用专家可以从共享专家初始化,快速适应。
-
可解释性:通过分析路由权重,可以观察模型在处理不同模态、不同语义内容时激活了哪些专家,提供决策透明性。
实践案例:Google的UniT、微软的BEiT-3等都已采用MoE思想。UniT中明确为图像、文本、音频等模态设置了不同的FFN专家,共享自注意力层,在跨模态理解和生成任务上取得了优异性能。
视频和音频的同步对齐在统一模型预训练时,如何设计预训练任务?如视听同步检测。¶
视频和音频天然携带时间维度,且两者在物理世界中有因果关联(物体碰撞产生声音、嘴唇运动与语音对应)。利用这种天然同步性,可以设计强大的自监督预训练任务。
核心预训练任务:
| 任务 | 实现方式 | 学习的目标 |
|---|---|---|
| 视听同步检测 (AVS) | 给定视频片段和音频片段,判断两者是否来自同一时刻。正样本为同一时间窗口的片段,负样本为不同时间的片段或不同视频的片段 | 学习音视频的时间对齐,辨别跨模态的因果关联 |
| 视听时间对比学习 | 拉近匹配的音视频帧嵌入,推远时间偏移的嵌入。类似SimCLR但跨模态 | 学习细粒度的音视频时间对应关系 |
| 掩码跨模态预测 | 随机mask掉视频的若干帧或音频的若干片段,要求模型根据未mask的模态预测缺失内容 | 学习跨模态补全,理解模态间的互补信息 |
| 音源定位 | 给定音频,要求模型在视频帧中定位发出声音的区域 | 学习细粒度的空间-声音对应 |
| 未来帧/声音预测 | 基于历史视频帧和音频,预测未来的视频帧或音频 | 学习时序因果关系和动态推理 |
具体训练策略:
- 构造训练数据:从视频中随机采样一个时间窗口的视频帧序列和对应的音频段作为正样本对。负样本可以通过以下方式构造:
- 时间偏移:音频与视频错位0.5-2秒。
- 跨视频替换:取视频A的帧,配视频B的音频。
-
速度扰动:加速或减速音频,改变同步性。
-
多任务联合训练:在统一模型预训练中,这些任务不是孤立的,而是与图文对比、文本生成等任务混合训练。通过在总损失中分配权重,模型同时学习静态图像-文本对齐和动态音视频对齐。
-
时间Transformer的引入:对于视频输入,在空间Transformer之后加入时间注意力层。对于音频,也采用类似架构。两者在时间维度上的表示可以进行对比学习。
这种预训练让模型理解“声音是由视觉事件引起的”这一物理常识,对于视频问答、事件定位和跨模态生成(如给视频配音效)至关重要。
在跨模态生成的统一模型中,如何解决“一对多”问题?¶
“一对多”问题指同一输入可对应多个不同的合理输出。例如,给定文本“一只猫”,可以生成毛色、姿态、背景各异的无数张猫的图片。这对使用确定性损失函数的模型构成挑战。
解决方案:
| 方法 | 原理 | 适用场景 |
|---|---|---|
| 引入噪声/潜变量 | 在生成过程中注入随机噪声,如扩散模型的初始噪声、VAE的潜变量采样。噪声的随机性驱动输出的多样性 | 文生图、文生视频 |
| 温度采样与Top-p采样 | 在自回归生成时,通过调整softmax温度和核采样,从概率分布中随机采样而非取最大概率 | 文本生成、图像token生成 |
| 多模态潜在空间插值 | 在跨模态嵌入空间中,对输入条件嵌入添加微小随机扰动,生成“同一语义的变体” | 风格迁移、图像编辑 |
| 显式多样性损失 | 在训练中加入多样性促进项,鼓励同一输入的不同噪声样本产生不同的输出 | 所有生成任务 |
| 条件增强 | 对输入条件进行随机增强(如文本改写、图像风格变换),使模型学习到条件的不变性,同时自然产生输出多样性 | 文生图、图生文 |
扩散模型天然适合一对多:扩散模型的去噪过程每次从不同随机噪声出发,自然地产生不同输出。这正是扩散模型在文生图领域占据主导地位的重要原因之一。
对于自回归模型:可以采用“生成多个候选+重排序”策略。先生成多个输出,再用另一个模型(如CLIP Score)从中挑选最符合输入且多样性好的结果。
本质理解:“一对多”不是模型的缺陷,而是现实世界语义多对多映射的体现。好的模型应该能够捕捉输出的条件分布,而非仅输出均值。评估时也需使用FID、IS等能度量多样性的指标,而非仅用MSE。
如何处理不同模态数据的规模和难易程度不均衡?¶
多模态预训练中,文本数据(万亿token级别)通常远大于高质量视频数据(十亿帧级别),而音频、深度图等更少。同时,模态本身的固有学习难度也不同:图像概念密集,音频时序结构强。
数据规模不均衡的应对:
| 方法 | 实现 | 优缺点 |
|---|---|---|
| 温度采样 | 对每个模态的数据集,按 pi∝Ni1/Tpi∝Ni1/T 采样。T>1T>1 时趋向均匀采样,T=1T=1 时按原始比例 | 简单灵活,TT 需调优 |
| 固定比例混合 | 无视原始数据量,强制每个batch中各模态数据占比固定(如文本30%、图像30%、视频20%、音频20%) | 过采样小数据集,可能过拟合;但保证模态均衡 |
| 课程学习 | 训练早期多用简单模态(文本、图像),后期逐渐增加困难模态(视频、音频)的比例 | 稳定收敛,但需设计课程 |
| 单模态预训练初始化 | 先用海量单模态数据预训练各编码器,再进行多模态联合训练。这缩小了模态间的表示差距 | 成本高,但效果最好 |
模态难度不均衡的应对:
-
动态损失加权:使用Uncertainty Weighting或GradNorm,自动调整各模态损失的权重。困难模态的损失下降慢,会被赋予更大权重,加速其学习。
-
学习率分离:给视觉等收敛慢的模态设置稍大的学习率,文本等收敛快的模态用较小学习率。
-
辅助任务:为困难模态设计额外的辅助任务,增加监督信号密度。例如,为视频添加帧级别的物体检测任务,为音频添加音素识别任务。
关键原则:大规模模态不应完全淹没小规模模态,但也不应为了“公平”而过度上采样小数据集导致过拟合。平衡点是让所有模态在验证集上各自的关键指标(如检索召回率)都能持续提升。
多模态统一模型的评估如何做?是否需要一个能评价所有模态的超级基准?¶
多模态统一模型的评估远比单一模型复杂,因为它不仅需要评估各模态内的任务,还要评估跨模态交互质量。超级基准是理想方向,但目前仍由多个专用基准拼凑而成。
当前评估范式:多基准聚合
| 模态组合 | 代表性基准 | 评估能力 |
|---|---|---|
| 文本+图像 | VQA-v2, GQA, MMBench, MME | 视觉理解、推理、OCR |
| 文本→图像 | MS-COCO FID, DrawBench | 生成质量、保真度、多样性 |
| 文本+视频 | Video-MME, MVBench | 视频理解、时序推理、动作识别 |
| 文本+音频 | Clotho, AudioCaps | 音频理解、描述生成 |
| 图像+文本+音频 | AVQA, MUSIC-AVQA | 视听联合理解 |
| 任意模态检索 | 构建跨模态检索测试集 | 模态间的语义对齐 |
迈向超级基准的努力:
目前的尝试是将上述子基准统一在一个评测框架下,如VLUE、MME等聚合了多个子任务。但一个真正能评价所有模态的超级基准需要满足:
-
任务全覆盖:从感知到认知,从理解到生成,覆盖所有模态组合。
-
公平可比:不同模态任务使用归一化分数,避免某一模态指标主导总分。
-
可诊断:不仅给总分,还能细化到各能力维度(计数、空间、时序等)。
实践中的评估策略:
-
在研发阶段,运行所有相关模态的基准测试,形成能力雷达图。
-
在上线前,重点评估核心业务场景的端到端表现。
-
建立“回归测试”套件,每次模型更新后自动运行,防止核心能力退化。
-
人工评估对于开放式生成任务(如对话、创作)仍不可或缺。
你认为“统一多模态大模型”何时能成熟到像现在的 LLM 一样?有哪些里程碑?¶
统一多模态大模型正处在类似GPT-2到GPT-3的过渡期——已有令人惊叹的demo能力,但在可靠性、可控性和效率上仍有显著不足。预计在未来3-5年内,它将在特定领域率先成熟。
发展路径与里程碑预测:
| 阶段 | 标志 | 时间预估 |
|---|---|---|
| 基础能力对齐 | Any-to-Any的生成能力在主流模态上达到可用水平,但幻觉率高 | 2024-2025(已达) |
| 可靠性突破 | 幻觉率显著降低(<5%),跨模态事实一致性达到人类水平;能在专业领域(医疗影像、法律)提供可靠辅助 | 2025-2027 |
| 实时与高效 | 视频流实时理解和生成达到消费级硬件可用;边缘设备可运行压缩版统一模型 | 2026-2028 |
| 具身智能闭环 | 统一模型驱动机器人完成长程物理任务,感知-规划-控制一体化,错误率低于人类 | 2027-2030 |
| 理论框架完善 | 对模态间信息转换的数学原理有深入理解;模态幻觉、偏见、鲁棒性问题有理论保证的解决方案 | 2030+ |
关键里程碑:
-
跨模态幻觉率降至接近单模态水平。当前多模态模型的幻觉是阻碍其落地的最大障碍。
-
长视频和长音频的无损理解与记忆。如同LLM可以处理百万token的上下文,多模态模型需要同等能力。
-
在多个专业资格考试中全面超越人类专家(类似LLM在律师、医生资格考试中的表现)。
-
能够作为操作系统级Agent,像人类一样操控GUI、调用工具、执行复杂多步任务,且成功率>95%。
-
出现公认的“统一多模态大模型评测超级基准”,社区对其有效性达成共识。
成熟的标志不是“能做所有事”,而是像现在的LLM一样:能力边界清晰、失效模式可预测、可通过标准化方法大幅提升可靠性。当开发者可以像今天调用GPT API一样,放心地将其用于生产环境中的多模态任务,统一多模态大模型就真正成熟了。
任意模态到任意模态(Any-to-Any)的统一模型是如何实现跨模态联合嵌入的?¶
跨模态联合嵌入是Any-to-Any模型的核心。它要求所有模态的数据都能被映射到一个共享的语义空间中,并在该空间中实现“语义相似则距离近、语义无关则距离远”。实现这一目标的技术路径主要有三条。
路径一:对比学习对齐
以CLIP为典型代表。对每一对匹配的跨模态数据(如图文对),使用对称InfoNCE损失拉近它们的嵌入向量,同时推远批次内其他不匹配对的嵌入。扩展到多模态时,可以采用“星型对比学习”:将所有模态对齐到一个枢纽模态(如图像),或者采用“全连接对比学习”:对所有两两模态对都施加对比损失。后者理论上更优,但计算量随模态数平方增长,实践中多采用星型或环型连接。
路径二:统一序列建模
将所有模态的数据通过VQ-VAE或类似Tokenizer离散化为统一的token序列,然后使用同一个自回归Transformer进行序列到序列的生成。在这种架构下,嵌入空间自然共享——因为文本token的嵌入表和图像token的嵌入表在同一个Transformer中被联合优化,生成过程中跨模态的注意力交互使得各模态的表示彼此融合。代表性工作如Unified-IO、Chameleon。
路径三:共享骨干+模态特定投影
使用一个巨大的Transformer作为共享骨干网络,在其前端和后端分别配备模态特定的编码器和解码器。每个模态的编码器将原始数据投影到共享的隐藏维度,骨干Transformer在此共享空间中进行跨模态交互和推理,解码器再将其投射回各模态的原始空间。关键设计在于:投影层虽然模态特定,但将不同模态的特征映射到了同一维度,使得骨干网络中的自注意力可以无差别地处理所有模态的token。
三种路径的融合:当前最先进的方法往往同时使用上述技术。例如,先用对比学习将各模态的表示空间粗对齐,再用统一序列建模进行细粒度的端到端训练。这种“预对齐+联合训练”的策略兼顾了训练效率和最终性能。
多模态 Tokenizer 的研究方向是什么?如何将图像、视频、音频统一离散化为 token?¶
多模态Tokenizer是将连续模态数据(图像、视频、音频)转化为离散token序列的关键组件,它使得这些模态能够像文本一样被自回归Transformer处理。当前研究方向集中在更高效、更语义化、更统一的离散化方法上。
主流技术方向:
| 方向 | 方法 | 代表工作 | 特点 |
|---|---|---|---|
| VQ-VAE及其变体 | 将编码后的连续特征通过码本量化为离散token | VQGAN, DALL-E的dVAE | 经典方案,重建质量好,但码本坍塌是挑战 |
| 视觉Transformer Patch | 直接将图像块线性投影为连续向量,作为“软token” | ViT, LLaVA视觉token | 非离散化方案,保留连续表示,但不能用于自回归生成图像 |
| 基于扩散的离散化 | 使用扩散模型将连续表示去噪到最近的码本向量 | DPM-Solver+VAE | 平衡重建质量与多样性 |
| 端到端可微分量化 | 使用Gumbel-Softmax或直通估计器实现离散化的可微近似 | FSQ (Finite Scalar Quantization) | 简化训练,避免码本坍塌,通过将每个维度量化为有限几个值实现 |
统一离散化的挑战:
不同模态的信息密度和特性差异巨大。图像空间冗余度高,需要大量token;音频时序结构强,需要密集时间采样;文本信息密度极高。将它们统一到一个离散token空间面临:
-
token数量不平衡:一张图像可能需要1024个token,一段文本可能仅需50个token。在同一序列中,视觉token会淹没文本token。
-
语义粒度不匹配:图像的“语义单元”是一个物体或区域,音频的“语义单元”是一个音素或声音事件。找到跨模态统一的语义粒度是开放难题。
未来方向:
-
学习型压缩Tokenizer:不仅仅压缩数据,还要学习哪些信息是语义相关的、哪些是可丢弃的纹理。用对比学习或生成任务引导Tokenizer保留更多语义信息。
-
动态长度Tokenization:根据内容复杂度自适应决定token数量。简单图像用少量token,复杂图像用更多。
-
跨模态共享码本:训练一个超级码本,同时覆盖图像、音频、视频的视觉特征,使不同模态的token在码本层面就实现语义对齐。
-
层次化Tokenization:粗粒度token捕捉全局语义(如场景类型),细粒度token捕捉局部细节。先预测粗token再预测细token,类似渐进式解码。
多模态大模型与知识图谱结合有哪些方式?能否动态检索外部知识库来减少幻觉?¶
知识图谱(KG)提供结构化、可验证的事实知识,恰好可以弥补MLLM因训练数据噪声或覆盖不全导致的幻觉问题。两者的结合从浅到深有多个层次。
结合方式:
| 方式 | 原理 | 代表工作 | 优缺点 |
|---|---|---|---|
| 前置注入 | 在预训练阶段,将KG三元组(实体-关系-实体)转换为自然语言描述,混入训练数据 | K-LITE, REACT | 隐式学习KG知识,但无法保证推理时使用 |
| 后置校验 | MLLM生成回答后,提取其中的事实性断言,调用KG验证是否正确。若错误,标记或重生成 | 基于工具调用的事实核查 | 可以事后纠正,但有延迟 |
| 动态检索增强(RAG+KG) | 在推理时,先解析用户问题中的实体,从KG中检索相关知识子图,转化为文本后作为附加上下文输入MLLM | KnowGPT, Graph RAG | 最灵活,实时性强,可显著降低幻觉 |
| 联合推理 | MLLM和KG交替推理。MLLM生成中间结论→KG查询验证→MLLM基于查询结果继续推理→... | 多步推理框架 | 推理能力强,但架构复杂 |
动态检索外部知识库减少幻觉的具体流程:
-
实体链接:从用户问题和图像中抽取关键实体(如“鸮鹦鹉”),在KG中定位对应节点。
-
子图检索:以这些实体为中心,检索1-2跳内的邻居节点和关系,形成知识子图。
-
知识序列化:将子图转化为MLLM可理解的文本描述。例如:“鸮鹦鹉,是一种鹦鹉,特性:不会飞,栖息地:新西兰,保护状况:极危。”
-
知识注入生成:将上述文本与原始问题、视觉token一起输入MLLM,生成回答。这样生成的回答基于检索到的权威知识,幻觉显著降低。
-
事后校验(可选额外步骤):MLLM输出的关键事实可再次查询KG进行验证。
关键挑战:实体从图像中链接到KG的准确率;KG的覆盖度和时效性;多跳推理的计算延迟。随着KG构建自动化(如用LLM从文本中抽取三元组)和向量化检索的发展,这些挑战正在被逐步克服。
长视频理解中,如何有效记忆和检索长时间跨度的信息?¶
长视频(数十分钟到数小时)包含海量时空信息,直接全部送入模型计算量不可承受,必须设计高效的记忆和检索机制。
核心技术方案:
| 方案 | 原理 | 优缺点 |
|---|---|---|
| 均匀采样 | 固定间隔(如每5秒1帧)抽取关键帧,丢弃中间帧 | 简单,但可能错过关键瞬间 |
| 记忆库压缩 | 使用Q-Former或Perceiver Resampler将视频片段压缩为固定数量的记忆token | 保留全局摘要,丢失细节 |
| 层次化记忆 | 维护多时间尺度的记忆:短期(秒级精细)、中期(分钟级事件)、长期(全局摘要) | 兼顾细节和全局,实现复杂 |
| 可学习的检索 | 训练一个轻量网络,输入查询和候选帧特征,输出相关性分数。在回答问题时,根据问题内容检索最相关的历史帧 | 灵活精准,但需要额外训练 |
| 时间锚点检测 | 预先在视频中检测关键事件(如场景切换、人物出现),为这些锚点建立索引 | 高效,但依赖事件检测的准确性 |
层次化记忆架构示例:

检索流程:
-
用户提问“那个穿红衣服的人在什么时候出现的?”
-
先从长期记忆中判断视频中是否有红衣服人物。
-
若有,根据中期记忆的时间戳,定位到人物可能出现的几分钟范围。
-
在该范围内激活短期记忆,进行高分辨率帧检索,找到精确时间点。
前沿方向:将长视频记忆建模为“可学习的记忆token序列”,通过交叉注意力机制让LLM在生成时动态从记忆库中检索。这种方法无需人工设计层次,完全由模型学习哪些信息值得记住。
视频问答中的“事件定位”和“时序推理”对模型提出了哪些新要求?¶
事件定位和时序推理是视频理解中超越简单“看图说话”的高阶能力。它们迫使模型不仅要理解每一帧的内容,还要理解帧与帧之间的时间逻辑关系。
事件定位(Temporal Grounding):
给定一段文本描述(如“女人拿起杯子喝水”),要求模型在视频中定位该事件发生的起止时间。这对模型提出了以下要求:
-
密集帧对比能力:需要分辨“手伸向杯子”和“手握住杯子”之间的微妙视觉差异,判断动作的精确边界。
-
长时间上下文感知:事件可能持续数秒到数分钟,模型需要对该时间窗口内所有帧的视觉特征进行细粒度比较和建模。
-
跨模态时间对齐:文本中的动词(“拿起”)需要与视频中的动态变化在时间轴上精确对应。
时序推理(Temporal Reasoning):
回答需要理解事件之间时间关系的问题,如“他进门之前做了什么?”这要求:
-
时序因果理解:不仅仅是知道事件A和B都发生了,还要理解A发生在B之前,且A可能是B的原因或前提。
-
事件序列记忆:模型需要按时间顺序存储多个事件,并能根据问题检索特定事件的前后事件。
-
相对时间关系判断:理解“之前”、“之后”、“同时”等时间连接词在视觉上的含义。
对模型架构和能力的新要求:
| 能力 | 传统视频理解 | 事件定位+时序推理需求 |
|---|---|---|
| 时间分辨率 | 秒级或更粗 | 需要毫秒级或帧级精确度 |
| 记忆机制 | 全局摘要即可 | 需要可索引的细粒度记忆,支持随机访问任意时间点 |
| 注意力模式 | 全帧均匀关注 | 需要能聚焦到动作变化的关键帧和关键区域 |
| 推理深度 | 单步问答 | 需要多步因果链推理 |
| 时间位置编码 | 简单顺序编码 | 需要能表达相对距离和绝对时间的位置编码方案 |
实现思路:
-
使用多尺度时间Transformer,在不同时间粒度上分别建模帧间关系。
-
引入可微分时间对齐模块,让模型学习为文本中的每个动词找到对应的时间区间。
-
在训练数据中构造大量时序对比对(如交换两个事件的顺序,问模型是否合理),增强模型的时序逻辑。
这些要求正在推动视频理解模型从“帧的集合”向“动态过程的连贯理解”进化,是多模态AI迈向真实世界理解的关键一步。