首页 > 人工智能

多模态视频理解模型新标杆!微软黄学东团队发布 i-Code

人类的智能涉及多个模态:我们整合视觉、语言和声音信号,从而形成对世界全面的认识。然而,目前大多数的预训练方法仅针对一到两种模态设计。

在本文中,我们提出了一种多模态自监督预训练框架「i-Code」,用户可以灵活地将视觉、语音和语言的形式组合成统一的通用的向量表征。在该框架下,我们首先将各个模态的数据输入给预训练的单模态编码器。接着,我们通过多模态融合网络集成各单模态编码器的输出,该网络使用新型注意力机制等架构创新,有效地融合了不同模态的信息。

我们使用新的目标端到端地预训练整个系统,新的目标包括掩码模态单元建模和交叉模态对比学习。不同于以往只使用视频进行预训练的研究,i-Code 框架可以在训练和推理过程中动态处理单模态、双模态和三模态数据,灵活地将不同的模态组合投影到单个表示空间中。实验结果表明,在 5 个视频理解任务和 GLUE NLP 基准测试上,i-Code 的表现相较于目前最先进的技术的提升高达 11%,展示了集成多模态预训练的威力!