VideoPrism

Ai模型最新工具VideoPrism,VideoPrism是一个通用的视频编码模型,能够在各种视频理解任务上取得领先的性能,包括分类、定位、检索、字幕生成和问答等。其创新点在于预训练的数据集非常大且多样,包含3600万高质量的视频-文本对,以及5.82亿带有嘈杂文本的视频剪辑。预训练采用两阶段策略,先利用对比学习匹配视频和文本,然后预测遮蔽的视频块,充分利用不同的监督信号。一个固定的VideoPrism模型可以直接适配到下游任务,并在30个视频理解基准上刷新状态最优成绩。

打开网站

VideoPrism是一个通用的视频编码模型,能够在各种视频理解任务上取得领先的性能,包括分类、定位、检索、字幕生成和问答等。其创新点在于预训练的数据集非常大且多样,包含3600万高质量的视频-文本对,以及5.82亿带有嘈杂文本的视频剪辑。预训练采用两阶段策略,先利用对比学习匹配视频和文本,然后预测遮蔽的视频块,充分利用不同的监督信号。一个固定的VideoPrism模型可以直接适配到下游任务,并在30个视频理解基准上刷新状态最优成绩。

需求人群: "- 视频分类、定位
– 视频检索
– 视频字幕生成
– 视频问答
– 科学视频分析" 使用场景示例: "- 利用VideoPrism进行视频分类,实现动作识别
– 应用VideoPrism提取视频特征,检索相似视频
– 基于VideoPrism为视频自动生成描述文字
– 与语言模型结合,构建视频问答系统" 产品特色: – 预训练数据包含3600万高质量视频-文本对,5820万带嘈杂文本的视频剪辑,数据规模最大、质量最高- 采用两阶段预训练策略,对比学习匹配视频和文本,预测遮蔽的视频块- 一个固定模型直接适配下游任务,无需调参和微调- 在30个视频理解基准上刷新最优记录