Rekreate
模型指南

OmniHuman:一张照片 + 音频 = 口型同步虚拟人视频

字节跳动的音频驱动人像动画模型如何工作,OmniHuman 1.5的改进,以及如何将其用于UGC虚拟人。

更新于 作者 Rekreate Editorial Team, AI视频研究
目录 OmniHuman如何工作OmniHuman版本OmniHuman一览OmniHuman与其他虚拟人方法的比较提升OmniHuman效果的技巧常见问题

OmniHuman是字节跳动推出的音频驱动虚拟人视频模型。只需提供一张人物或角色的图片一段音频轨道,即可生成一个口型同步、带有面部表情、头部动作和身体手势的虚拟人视频。研究模型OmniHuman-12025年2月发布,而OmniHuman 1.52025年8月发布,新增了音频语义理解功能,使手势和情感不仅匹配节奏,还能匹配内容

在Rekreate中,OmniHuman支持音频驱动的虚拟人视频:您只需提供一张肖像、一段音频轨道(例如克隆的声音)以及一个简短的指导提示。

关键要点
  • **输入:**一张图片(肖像、半身或全身)+ 音频 + 可选文本指导。
  • **输出:**口型同步的虚拟人视频或唱歌视频,带有自然手势。
  • **OmniHuman-1:**2025年2月 · **OmniHuman 1.5:**2025年8月,新增MLLM规划的情感和手势,视频时长约30秒。
  • **最佳用途:**UGC虚拟人视频、无脸讲解视频、角色对话、音乐片段。
  • **在Rekreate中:**图片 + 音频 + 提示,自动检测说话主体。

OmniHuman如何工作

早期的虚拟人工具主要是动画化裁剪面部的嘴部区域。OmniHuman通过**“全条件”训练——将音频、姿态和文本信号混合训练——可以动画化任何构图**:特写肖像、半身照片和全身图片,包括手势、与物体的互动。

OmniHuman 1.5引入了双系统设计:一个多模态大语言模型首先理解音频(及可选文本)的含义和情感,规划适当的反应和手势,然后一个扩散变换器渲染动作。结果是一个能够对内容做出反应的表演——强调关键词、停顿、在笑点微笑——并能根据文本指令控制镜头和手势。

OmniHuman版本

2025年2月

OmniHuman-1

研究论文和演示展示了从一张图片加音频生成真实感人像视频,包括肖像、半身和全身构图,支持说话和唱歌,以及卡通和风格化角色。

2025年8月

OmniHuman 1.5

新增基于MLLM的语义规划功能,支持情感和手势的上下文感知,支持文本指导镜头和手势,多人场景以及更长、更连续的视频(在常见API上约30秒)。

不同平台提供的版本有所不同;字节跳动通过BytePlus/火山引擎及其Dreamina/剪映生态系统提供OmniHuman。

OmniHuman一览

开发者 字节跳动(智能创作 / OmniHuman实验室)
输入 单张图片、音频轨道、可选文本提示
构图 肖像、半身、全身;真实感和风格化角色
动作 口型同步、面部表情、头部和身体手势、部分物体互动
典型时长 每次生成约30秒(1.5,取决于提供商)
在Rekreate中 图片 + 音频 + 提示;自动检测动画主体

OmniHuman与其他虚拟人方法的比较

  • **与工作室虚拟人(HeyGen、Synthesia)相比:**这些使用预训练的数字双胞胎录制视频;OmniHuman可以动画化任何单张图片,适合快速生成新角色,但对于超长脚本控制力较弱。
  • **与Seedance 2.x对话相比:**Seedance通过提示和参考生成完整场景;OmniHuman专注于让特定图片与特定音频轨道紧密口型同步。
  • **与Kling Motion Control相比:**Motion Control从参考视频复制动作;OmniHuman从音频生成动作。

在Rekreate中常见的组合是:重现一个热门脚本 → 用克隆声音生成语音 → 用OmniHuman动画化肖像 → 添加Seedance或Veo的辅助镜头 → 添加字幕。

提升OmniHuman效果的技巧

  1. 使用清晰、正面照片,嘴部可见且表情中性。
  2. **根据内容匹配构图:**半身照片允许手势;特写肖像专注于面部表情。
  3. 干净音频(没有音乐覆盖语音)可提供最准确的口型同步。
  4. 保持台词自然——带有停顿的对话式脚本比快速单调的朗读效果更好。
  5. 使用提示进行指导: “语气温暖,小幅点头,偶尔手势,静态镜头。”
  6. 获得许可后再动画化真实人物肖像,并在平台要求时标注AI生成内容。

常见问题

什么是OmniHuman?

OmniHuman是字节跳动的AI模型,可从单张图片和音频轨道生成真实感的说话或唱歌视频,带有口型同步、面部表情和身体手势。

OmniHuman-1和OmniHuman 1.5有什么区别?

OmniHuman 1.5(2025年8月)新增了一个多模态LLM,可以理解音频的含义和情感以规划手势和表情,支持文本指导镜头和手势,并生成比OmniHuman-1(2025年2月)更长、更连续的视频。

OmniHuman视频最长可以多长?

常见的OmniHuman 1.5 API每次生成视频时长约30秒;具体限制取决于提供商。

OmniHuman可以动画化卡通角色吗?

可以。它支持风格化、卡通和动漫角色,以及真实感肖像。

OmniHuman可以在Rekreate中使用吗?

可以。Rekreate使用OmniHuman生成音频驱动的虚拟人视频:提供一张图片、一段音频轨道和一个简短提示。

我可以用名人照片使用OmniHuman吗?

不可以。未经许可动画化真实人物可能违反平台规则和肖像权法律。请使用自己的照片(获得许可)、授权虚拟人或原创AI角色。

用 Rekreate 制作你的下一个爆款视频

找到一个经过验证的短视频,使用你的脚本、虚拟人像和声音复刻它,并在一个工作空间内用 Seedance、Kling 和 Veo 生成场景。

开始免费试用 →

相关指南

来源

  1. OmniHuman 1.5 audio-driven digital human, Hedra
  2. OmniHuman 1.5 image and audio to video, RunComfy
  3. OmniHuman 1.5 explained, Vidmuse