OmniHumanはByteDanceが開発した音声駆動型の人間アニメーションモデルです。1枚の人物またはキャラクターの画像と音声トラックを入力するだけで、リップシンク、表情、頭の動き、体のジェスチャーが一致した動画を生成します。研究モデルのOmniHuman-1は2025年2月に発表され、OmniHuman 1.5は2025年8月に発表されました。この新バージョンでは、音声の意味を理解し、ジェスチャーや感情を内容に合わせて調整する機能が追加されました。
Rekreateでは、OmniHumanを使用して音声駆動型アバター動画を作成できます。ポートレート画像、音声トラック(例:クローン音声)、短いガイディングプロンプトを提供するだけです。
- 入力: 1枚の画像(ポートレート、半身、全身)+ 音声 + オプションのテキストガイダンス。
- 出力: リップシンクされたトーキングまたは歌唱動画(自然なジェスチャー付き)。
- OmniHuman-1: 2025年2月 · OmniHuman 1.5: 2025年8月、MLLMによる感情とジェスチャーの計画機能を追加、約30秒のクリップ対応。
- 最適用途: UGCトーキングヘッド、顔を映さない解説動画、キャラクターダイアログ、音楽クリップ。
- Rekreateでの使用: 画像 + 音声 + プロンプト、自動的に話者を検出してアニメーション化。
OmniHumanの仕組み
従来のトーキングヘッドツールは、主に顔の一部(口元)のアニメーションに限定されていました。一方、OmniHumanは**「オムニ条件」**(音声、ポーズ、テキスト信号を混合したトレーニング)を使用しており、あらゆるフレーミングに対応可能です:クローズアップのポートレート、半身、全身画像、さらには手やジェスチャー、物体とのインタラクションも含みます。
OmniHuman 1.5ではデュアルシステム設計を導入しました。**マルチモーダル大規模言語モデル(MLLM)**が音声(およびオプションのテキスト)の意味と感情を解釈し、適切な反応やジェスチャーを計画します。その後、ディフュージョントランスフォーマーが動きをレンダリングします。この結果、コンテンツに反応するパフォーマンスが実現され、キーワードの強調、間の取り方、パンチラインでの笑顔などが可能になります。また、カメラやジェスチャーの制御に関するテキスト指示にも従います。
OmniHumanのバージョン
OmniHuman-1
1枚の画像と音声からリアルな人間動画を生成する研究論文とデモ。ポートレート、半身、全身フレーミング、話す・歌う動作、アニメやスタイライズされたキャラクターも対応。
OmniHuman 1.5
MLLMベースの意味計画機能を追加し、文脈に応じた感情とジェスチャーを実現。カメラやジェスチャーのテキストガイダンス、複数人シーン、より長く連続した動画(一般的なAPIで約30秒まで)に対応。
利用可能なバージョンはプラットフォームによって異なります。ByteDanceはOmniHumanをBytePlus/Volcano EngineおよびDreamina/CapCutエコシステムを通じて提供しています。
OmniHumanの概要
| 開発者 | ByteDance(Intelligent Creation / OmniHuman Lab) |
|---|---|
| 入力 | 1枚の画像、音声トラック、オプションのテキストプロンプト |
| フレーミング | ポートレート、半身、全身;リアルおよびスタイライズキャラクター |
| 動作 | リップシンク、表情、頭と体のジェスチャー、一部の物体とのインタラクション |
| 通常の長さ | 1回の生成で約30秒まで(1.5、プロバイダー依存) |
| Rekreateでの使用 | 画像 + 音声 + プロンプト;アニメーション化する対象を自動検出 |
OmniHumanと他のアバターアプローチの比較
- スタジオアバター(HeyGen、Synthesia)との比較: これらは事前に録画されたデジタルツインを使用しますが、OmniHumanは任意の1枚の画像をアニメーション化でき、新しいキャラクターに迅速に対応可能。ただし、非常に長いスクリプトには向きません。
- Seedance 2.xダイアログとの比較: Seedanceはプロンプトと参照から音声を生成し、シーン全体を作成します。一方、OmniHumanは特定の画像を特定の音声トラックに合わせてリップシンクさせることに特化しています。
- Kling Motion Controlとの比較: Motion Controlは参照動画から動きをコピーしますが、OmniHumanは音声から動きを生成します。
UGCでは、Rekreateでの一般的な組み合わせは次の通りです:バイラルスクリプトを再現 → クローン音声で声を生成 → ポートレートをOmniHumanでアニメーション化 → SeedanceやVeoでBロールを追加 → キャプションを付ける。
OmniHumanでより良い結果を得るためのヒント
- 鮮明で正面向きの画像を使用し、口元が見える中立的な表情を選びましょう。
- コンテンツに合わせたフレーミングを選択:半身画像は手のジェスチャーを可能にし、クローズアップは表情に焦点を当てます。
- クリアな音声(スピーチの下に音楽がないもの)が最も正確なリップシンクを実現します。
- 自然なセリフを心がけましょう。間を取った会話調のスクリプトは、単調で早口な読み上げよりもアニメーションが自然になります。
- プロンプトを活用して指示を出しましょう:「温かみのある口調で話し、小さくうなずき、時折手のジェスチャー、カメラは固定。」
- 実在の人物の肖像をアニメーション化する場合は同意を得ること、またプラットフォームの規定に従いAI生成コンテンツであることを明示してください。
よくある質問
OmniHumanとは?
OmniHumanはByteDanceが開発したAIモデルで、1枚の画像と音声トラックからリアルなトーキングまたは歌唱動画を生成します。リップシンク、表情、体のジェスチャーが特徴です。
OmniHuman-1とOmniHuman 1.5の違いは?
OmniHuman 1.5(2025年8月)は、音声の意味と感情を理解してジェスチャーや表情を計画するマルチモーダルLLMを追加し、カメラやジェスチャーのテキストガイダンスをサポート。OmniHuman-1(2025年2月)よりも長く連続した動画を生成可能です。
OmniHuman動画の長さはどのくらい?
一般的なOmniHuman 1.5 APIでは、1回の生成で約30秒までの動画を作成可能です。制限はプロバイダーによります。
OmniHumanはアニメキャラクターをアニメーション化できますか?
はい。スタイライズされたキャラクター、アニメ、漫画のキャラクターにも対応しています。
OmniHumanはRekreateで利用可能ですか?
はい。RekreateではOmniHumanを使用して音声駆動型アバター動画を作成できます。画像、音声トラック、短いプロンプトを提供するだけです。
OmniHumanで有名人の写真を使用できますか?
いいえ。実在の人物を同意なくアニメーション化することは、プラットフォームの規定や肖像権に関する法律に違反する可能性があります。自身の画像、許可を得た画像、ライセンスされたアバター、またはオリジナルのAIキャラクターを使用してください。
Rekreateで次のバズる動画を作成しよう
実績のあるショート動画を見つけて、自分のスクリプト、アバター、声で再現し、Seedance、Kling、Veoを使ってシーンを生成するワークスペース。
無料トライアルを開始 →