OmniHuman是字节跳动推出的音频驱动虚拟人视频模型。只需提供一张人物或角色的图片和一段音频轨道,即可生成一个口型同步、带有面部表情、头部动作和身体手势的虚拟人视频。研究模型OmniHuman-1于2025年2月发布,而OmniHuman 1.5于2025年8月发布,新增了音频语义理解功能,使手势和情感不仅匹配节奏,还能匹配内容。
在Rekreate中,OmniHuman支持音频驱动的虚拟人视频:您只需提供一张肖像、一段音频轨道(例如克隆的声音)以及一个简短的指导提示。
- **输入:**一张图片(肖像、半身或全身)+ 音频 + 可选文本指导。
- **输出:**口型同步的虚拟人视频或唱歌视频,带有自然手势。
- **OmniHuman-1:**2025年2月 · **OmniHuman 1.5:**2025年8月,新增MLLM规划的情感和手势,视频时长约30秒。
- **最佳用途:**UGC虚拟人视频、无脸讲解视频、角色对话、音乐片段。
- **在Rekreate中:**图片 + 音频 + 提示,自动检测说话主体。
OmniHuman如何工作
早期的虚拟人工具主要是动画化裁剪面部的嘴部区域。OmniHuman通过**“全条件”训练——将音频、姿态和文本信号混合训练——可以动画化任何构图**:特写肖像、半身照片和全身图片,包括手势、与物体的互动。
OmniHuman 1.5引入了双系统设计:一个多模态大语言模型首先理解音频(及可选文本)的含义和情感,规划适当的反应和手势,然后一个扩散变换器渲染动作。结果是一个能够对内容做出反应的表演——强调关键词、停顿、在笑点微笑——并能根据文本指令控制镜头和手势。
OmniHuman版本
OmniHuman-1
研究论文和演示展示了从一张图片加音频生成真实感人像视频,包括肖像、半身和全身构图,支持说话和唱歌,以及卡通和风格化角色。
OmniHuman 1.5
新增基于MLLM的语义规划功能,支持情感和手势的上下文感知,支持文本指导镜头和手势,多人场景以及更长、更连续的视频(在常见API上约30秒)。
不同平台提供的版本有所不同;字节跳动通过BytePlus/火山引擎及其Dreamina/剪映生态系统提供OmniHuman。
OmniHuman一览
| 开发者 | 字节跳动(智能创作 / OmniHuman实验室) |
|---|---|
| 输入 | 单张图片、音频轨道、可选文本提示 |
| 构图 | 肖像、半身、全身;真实感和风格化角色 |
| 动作 | 口型同步、面部表情、头部和身体手势、部分物体互动 |
| 典型时长 | 每次生成约30秒(1.5,取决于提供商) |
| 在Rekreate中 | 图片 + 音频 + 提示;自动检测动画主体 |
OmniHuman与其他虚拟人方法的比较
- **与工作室虚拟人(HeyGen、Synthesia)相比:**这些使用预训练的数字双胞胎录制视频;OmniHuman可以动画化任何单张图片,适合快速生成新角色,但对于超长脚本控制力较弱。
- **与Seedance 2.x对话相比:**Seedance通过提示和参考生成完整场景;OmniHuman专注于让特定图片与特定音频轨道紧密口型同步。
- **与Kling Motion Control相比:**Motion Control从参考视频复制动作;OmniHuman从音频生成动作。
在Rekreate中常见的组合是:重现一个热门脚本 → 用克隆声音生成语音 → 用OmniHuman动画化肖像 → 添加Seedance或Veo的辅助镜头 → 添加字幕。
提升OmniHuman效果的技巧
- 使用清晰、正面照片,嘴部可见且表情中性。
- **根据内容匹配构图:**半身照片允许手势;特写肖像专注于面部表情。
- 干净音频(没有音乐覆盖语音)可提供最准确的口型同步。
- 保持台词自然——带有停顿的对话式脚本比快速单调的朗读效果更好。
- 使用提示进行指导: “语气温暖,小幅点头,偶尔手势,静态镜头。”
- 获得许可后再动画化真实人物肖像,并在平台要求时标注AI生成内容。
常见问题
什么是OmniHuman?
OmniHuman是字节跳动的AI模型,可从单张图片和音频轨道生成真实感的说话或唱歌视频,带有口型同步、面部表情和身体手势。
OmniHuman-1和OmniHuman 1.5有什么区别?
OmniHuman 1.5(2025年8月)新增了一个多模态LLM,可以理解音频的含义和情感以规划手势和表情,支持文本指导镜头和手势,并生成比OmniHuman-1(2025年2月)更长、更连续的视频。
OmniHuman视频最长可以多长?
常见的OmniHuman 1.5 API每次生成视频时长约30秒;具体限制取决于提供商。
OmniHuman可以动画化卡通角色吗?
可以。它支持风格化、卡通和动漫角色,以及真实感肖像。
OmniHuman可以在Rekreate中使用吗?
可以。Rekreate使用OmniHuman生成音频驱动的虚拟人视频:提供一张图片、一段音频轨道和一个简短提示。
我可以用名人照片使用OmniHuman吗?
不可以。未经许可动画化真实人物可能违反平台规则和肖像权法律。请使用自己的照片(获得许可)、授权虚拟人或原创AI角色。
用 Rekreate 制作你的下一个爆款视频
找到一个经过验证的短视频,使用你的脚本、虚拟人像和声音复刻它,并在一个工作空间内用 Seedance、Kling 和 Veo 生成场景。
开始免费试用 →