Mage-VL震撼发布:40亿参数 codec-native 多模态模型如何颠覆实时视频理解?
【免费下载链接】Mage-VL项目地址: https://ai.gitcode.com/hf_mirrors/microsoft/Mage-VL
Mage-VL 是一款 codec-native 的主动流多模态基础模型,专为图像和视频理解打造,其视觉编码器以紧凑的 40 亿参数规模完全从头开始训练。它旨在解决现代 VLMs 的“莫拉维克悖论”——在复杂的离线推理方面表现出色,但在简单的实时流感知上速度慢且计算量大。
核心特性: codec-native 架构的突破
Mage-VL 摒弃了将视频解码为均匀采样帧并将密集的补丁标记通过冻结的网络预训练 ViT 的传统方式,而是遵循现代视频编解码器的结构:将流分离为锚定(I)帧和预测(P)帧,保留每个锚定补丁,并仅保留编解码器花费比特的预测帧补丁——即携带真实运动和新细节的区域。这种编解码器对齐的稀疏性使 Mage-VL 能够以传统方法 1/10 的计算成本处理实时视频流。
从 scratch 训练的视觉编码器
我们还发布了microsoft/Mage-ViT——来自两阶段从头开始 ViT 预训练的独立视觉编码器。这仅是ViT 预训练检查点:它尚未与语言模型进行联合 VLM 训练。您可以将其用作数据高效的 codec-native 视觉编码器,或作为您自己的多模态训练的即插即用 ViT。
| 模型 | 描述 | 架构 |
|---|---|---|
Mage-ViT | codec-native 视觉编码器——仅 ViT 预训练,无 VLM 联合训练 | Codec-ViT(从头开始) |
主动流框架:智能感知与响应
主动流框架——Mage-ViT 将连续流增量编码为事件门和因果解码器共享的 codec-native 视觉特征。该门对每个滚动窗口进行评分,并在常规内容上保持静默;当它打开时,解码器会发出事件条件响应。这种机制确保模型仅在关键事件发生时才进行处理和响应,大大提高了实时性和效率。
实际应用:SoccerNet 响应时间测试
在 SoccerNet 测试中,Mage-VL 在 StreamMind 协议、codec-native 输入和零容忍画布匹配的条件下,展现出了出色的响应时间表现。加粗部分表示列中最佳结果,充分证明了其在实时视频理解任务中的优势。
如果您想体验 Mage-VL 的强大功能,可以通过以下命令克隆仓库:git clone https://gitcode.com/hf_mirrors/microsoft/Mage-VL,开始探索这一颠覆性的多模态模型。
【免费下载链接】Mage-VL项目地址: https://ai.gitcode.com/hf_mirrors/microsoft/Mage-VL
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考