图像生成大厂出品

VideoPoet——零样本视频生成与编辑大模型

VideoPoet是Google Research开发的大型语言模型,旨在将自回归语言模型转化为高质量视频生成器。它支持文本到视频、图像到视频、视频风格化、修复及视频到音频等多种任务。通过统...

标签:

产品简介

VideoPoet是由Google Research推出的一种创新建模方法,能够将任何自回归语言模型或大型语言模型(LLM)转化为高质量的视频生成器。该模型的核心优势在于其零样本(Zero-Shot)生成能力,无需针对特定任务进行微调即可处理多种视频-centric的输入和输出。VideoPoet展示了语言模型在合成和编辑视频方面的高度时间一致性,特别是在生成大范围、有趣且高保真的运动画面方面表现卓越。

核心功能

VideoPoet支持多种多模态生成任务,涵盖了从基础生成到复杂编辑的广泛需求:

  • 文本到视频:根据文本提示生成高动态、可变长度的视频片段。
  • 图像到视频:接收静态图像输入,并结合文本提示生成与之匹配的动态视频。
  • 视频风格化:在保留原始视频内容结构的同时,根据文本指引应用特定的艺术风格或视觉效果。
  • 视频修复与扩展:支持视频帧的延续(Continuation)、内补(Inpainting)和外补(Outpainting),能够修复缺失部分或扩展视频画面。
  • 视频到音频:无需文本指导,直接根据输入视频内容生成匹配的音频轨道。

技术原理与工作方式

VideoPoet的工作流程基于几个关键组件的协同作用。首先,预训练的MAGVIT V2视频tokenizer和SoundStream音频tokenizer将图像、视频和音频剪辑转换为统一词汇表中的离散代码序列。这些代码与基于文本的语言模型兼容,促进了多模态的整合。

随后,自回归语言模型跨视频、图像、音频和文本模态进行学习,自回归地预测序列中的下一个视频或音频token。训练框架中引入了混合的多模态生成学习目标,使得模型能够灵活组合不同任务,从而实现如文本到音频等额外的零样本能力。

特色能力

长视频生成与对象保持

虽然默认输出为2秒视频,但VideoPoet具备生成长视频的能力。通过以1秒视频片段为输入预测接下来1秒的输出,并重复此过程,可生成任意时长的视频。在此过程中,模型展现出强大的对象身份保持能力,确保角色和物体在长时间序列中的一致性。

可控相机运动

作为预训练的涌现属性,用户可以通过在文本提示中指定镜头类型来控制相机运动。支持的镜头包括缩放(Zoom out)、推拉变焦(Dolly zoom)、左摇(Pan left)、弧拍(Arc shot)、吊臂拍摄(Crane shot)以及第一人称视角无人机拍摄(FPV drone shot)等。

交互式视频编辑

模型支持交互式编辑,允许用户扩展输入视频的短持续时间,并从生成的候选列表中选择最佳结果。这种机制让用户能够精细控制所需的运动类型,例如让同一主体执行不同的舞蹈动作或应对不同的环境变化。

适用人群与场景

VideoPoet适用于需要高效创作视觉内容的专业人士和爱好者:

  • 内容创作者:用于制作短视频、社交媒体素材及视觉故事叙述。
  • 影视后期人员:利用视频修复、风格化和扩展功能进行创意编辑。
  • 游戏开发者:生成概念艺术动画或动态背景素材。
  • 研究人员:探索多模态大模型在视频生成领域的应用潜力。

使用建议

为了获得最佳生成效果,建议在文本提示中详细描述画面内容、运动方式及艺术风格。对于风格化任务,可以尝试组合基础提示与特定风格描述(如“数字艺术”、“铅笔素描”、“水墨画”等)。在进行长视频生成时,注意监控对象的一致性,必要时可通过分段生成后拼接的方式优化最终效果。

常见问题

VideoPoet支持哪些视频分辨率和比例?

VideoPoet模型支持生成方形取向的视频,也支持竖屏比例,以便更好地适配短视频平台的内容需求。具体生成质量取决于输入提示的详细程度及模型的零样本泛化能力。

如何实现视频风格的转换?

用户只需提供原始视频作为输入,并在文本提示中描述期望的目标风格(例如“油画风格”、“赛博朋克”或“剪纸艺术”)。模型会自动分析视频内容并应用相应的视觉风格,同时保持原始动作的连贯性。

VideoPoet能否为无声视频添加音效?

是的,VideoPoet具备视频到音频的功能。它可以在不使用任何文本指导的情况下,分析输入视频的画面内容,并生成与之匹配的音频轨道,包括环境音、动作音效等,从而增强视频的沉浸感。

数据统计

相关导航