Rekreate
دليل النماذج

OmniHuman: صورة واحدة + صوت = فيديو يتحدث

كيف يعمل نموذج الرسوم المتحركة البشري المعتمد على الصوت من ByteDance، وما الذي تم تحسينه في OmniHuman 1.5، وكيفية استخدامه لـ UGC avatars.

محدث بواسطة Rekreate Editorial Team, أبحاث الفيديو بالذكاء الاصطناعي
المحتويات كيف يعمل OmniHumanإصدارات OmniHumanنظرة عامة على OmniHumanOmniHuman مقابل أساليب avatar الأخرىنصائح للحصول على نتائج أفضل مع OmniHumanالأسئلة الشائعة

OmniHuman هو نموذج فيديو بشري يعتمد على الصوت من ByteDance. قم بتزويده بصورة واحدة لشخص أو شخصية ومسار صوتي، وسيقوم بإنشاء فيديو يتحدث فيه الموضوع أو يغني بمزامنة شفاه دقيقة، مع تعبيرات وجه، وحركات رأس، وإيماءات جسدية. تم الكشف عن نموذج البحث OmniHuman-1 في فبراير 2025، بينما أُطلق OmniHuman 1.5 في أغسطس 2025 مع تحسينات لفهم المعنى الصوتي بحيث تتطابق الإيماءات والمشاعر مع ما يُقال، وليس فقط الإيقاع.

في Rekreate، يُستخدم OmniHuman لإنشاء فيديوهات avatar تعتمد على الصوت: قم بتزويد صورة شخصية، ومسار صوتي (مثل صوت مستنسخ) وإرشادات قصيرة.

النقاط الرئيسية
  • المدخلات: صورة واحدة (بورتريه، نصف جسم أو جسم كامل) + صوت + نص إرشادي اختياري.
  • المخرجات: فيديو يتحدث أو يغني بمزامنة شفاه طبيعية مع إيماءات طبيعية.
  • OmniHuman-1: فبراير 2025 · OmniHuman 1.5: أغسطس 2025 مع تخطيط عاطفي وإيمائي يعتمد على MLLM، ومقاطع تصل إلى ~30 ثانية.
  • الأفضل لـ: رؤوس متحدثة لـ UGC، فيديوهات توضيحية بدون وجه، حوارات الشخصيات، مقاطع موسيقية.
  • في Rekreate: صورة + صوت + إرشادات، مع اكتشاف تلقائي للشخص المتحدث.

كيف يعمل OmniHuman

كانت الأدوات السابقة لرؤوس متحدثة تركز في الغالب على تحريك منطقة الفم في وجه مقصوص. تم تدريب OmniHuman باستخدام "شروط شاملة" — إشارات صوتية، وضعية ونص مختلطة أثناء التدريب — بحيث يمكنه تحريك أي إطار: صور قريبة، نصف جسم، وجسم كامل، بما في ذلك الأيدي، الإيماءات والتفاعل مع الأشياء.

قدّم OmniHuman 1.5 تصميمًا بنظام مزدوج: يقوم نموذج لغة كبير متعدد الوسائط أولاً بتفسير المعنى والعاطفة من الصوت (والنص الاختياري)، ويخطط ردود الفعل والإيماءات المناسبة، ثم يقوم محول الانتشار بتقديم الحركة. النتيجة هي أداء يتفاعل مع المحتوى — التركيز على الكلمات الرئيسية، التوقفات، الابتسامات عند النقاط المهمة — ويمكنه اتباع التعليمات النصية للتحكم بالكاميرا والإيماءات.

إصدارات OmniHuman

فبراير 2025

OmniHuman-1

ورقة بحثية وعروض توضيحية تُظهر فيديو بشري واقعي من صورة واحدة بالإضافة إلى صوت، عبر إطارات بورتريه، نصف جسم وجسم كامل، يتحدث ويغني، بما في ذلك الرسوم الكرتونية والشخصيات المرسومة.

أغسطس 2025

OmniHuman 1.5

يضيف تخطيطًا سياقيًا للإيماءات والمشاعر يعتمد على MLLM، إرشادات نصية اختيارية للكاميرا والإيماءات، مشاهد متعددة الأشخاص وفيديوهات أطول وأكثر استمرارية (حتى حوالي 30 ثانية على واجهات برمجة التطبيقات الشائعة).

تختلف الإصدارات المتاحة حسب المنصة؛ تقدم ByteDance OmniHuman من خلال BytePlus/Volcano Engine ونظام Dreamina/CapCut.

نظرة عامة على OmniHuman

المطور ByteDance (الإبداع الذكي / مختبر OmniHuman)
المدخلات صورة واحدة، مسار صوتي، نص إرشادي اختياري
الإطارات بورتريه، نصف جسم، جسم كامل؛ شخصيات واقعية ومصممة بأسلوب معين
الحركة مزامنة شفاه، تعبيرات الوجه، حركات الرأس والجسم، بعض التفاعل مع الأشياء
الطول النموذجي حتى ~30 ثانية لكل جيل (1.5، يعتمد على المزود)
في Rekreate صورة + صوت + إرشادات؛ اكتشاف تلقائي للشخصية المتحركة

OmniHuman مقابل أساليب avatar الأخرى

  • مقارنة بـ studio avatars (HeyGen, Synthesia): تلك تستخدم توائم رقمية مُدربة مسبقًا ومسجلة بالفيديو؛ OmniHuman يُحرك أي صورة واحدة، مما يجعله أسرع للشخصيات الجديدة ولكنه أقل تحكمًا للنصوص الطويلة جدًا.
  • مقارنة بـ Seedance 2.x للحوار: Seedance يُنتج مشاهد كاملة بالصوت من الإرشادات والمراجع؛ OmniHuman متخصص في جعل صورة معينة تتحدث مسار صوتي معين بمزامنة شفاه دقيقة.
  • مقارنة بـ Kling Motion Control: Motion Control ينسخ الحركة من فيديو مرجعي؛ OmniHuman يبتكر الحركة من الصوت.

بالنسبة لـ UGC، تركيبة شائعة في Rekreate هي: إعادة إنشاء نص فيروسي → توليد الصوت بصوت مستنسخ → تحريك صورة بورتريه باستخدام OmniHuman → إضافة لقطات إضافية من Seedance أو Veo → إضافة الترجمة.

نصائح للحصول على نتائج أفضل مع OmniHuman

  1. استخدم صورة واضحة ومباشرة مع فم مرئي وتعبير محايد.
  2. طابق الإطار مع المحتوى: صور نصف الجسم تسمح بإيماءات اليد؛ الصور القريبة تركز على تعبيرات الوجه.
  3. استخدم صوتًا نظيفًا (بدون موسيقى تحت الكلام) للحصول على مزامنة شفاه دقيقة.
  4. اجعل النصوص طبيعية — النصوص الحوارية مع توقفات تتحرك بشكل أفضل من القراءات السريعة الرتيبة.
  5. استخدم الإرشادات للتوجيه: "يتحدث بحرارة، إيماءات صغيرة بالرأس، إيماءات يد عرضية، كاميرا ثابتة."
  6. احصل على الموافقة قبل تحريك صورة شخص حقيقي، وقم بوضع علامة على المحتوى الذي تم إنشاؤه بالذكاء الاصطناعي حيثما تتطلب المنصات ذلك.

الأسئلة الشائعة

ما هو OmniHuman؟

OmniHuman هو نموذج ذكاء اصطناعي من ByteDance يُنتج فيديو يتحدث أو يغني بشكل واقعي من صورة واحدة ومسار صوتي، مع مزامنة شفاه، تعبيرات وجه وإيماءات جسدية.

ما الفرق بين OmniHuman-1 و OmniHuman 1.5؟

OmniHuman 1.5 (أغسطس 2025) يضيف نموذج LLM متعدد الوسائط الذي يفهم معنى وعاطفة الصوت لتخطيط الإيماءات والتعبيرات، يدعم الإرشادات النصية للكاميرا والإيماءات، ويُنتج فيديوهات أطول وأكثر استمرارية مقارنة بـ OmniHuman-1 (فبراير 2025).

ما هو طول الفيديوهات التي يمكن أن يُنتجها OmniHuman؟

تُنتج واجهات برمجة التطبيقات الشائعة لـ OmniHuman 1.5 فيديوهات تصل إلى حوالي 30 ثانية لكل تشغيل؛ تختلف الحدود حسب المزود.

هل يمكن لـ OmniHuman تحريك الرسوم الكرتونية؟

نعم. يعمل مع الشخصيات المصممة بأسلوب معين، الكرتونية والأنمي، بالإضافة إلى الصور الواقعية.

هل OmniHuman متاح في Rekreate؟

نعم. يستخدم Rekreate OmniHuman لإنشاء فيديوهات avatar تعتمد على الصوت: قم بتزويد صورة، مسار صوتي وإرشادات قصيرة.

هل يمكنني استخدام صورة شخصية مشهورة مع OmniHuman؟

لا. تحريك صور أشخاص حقيقيين بدون موافقة قد ينتهك قواعد المنصات والقوانين المتعلقة بالشبه. استخدم صورتك الخاصة بموافقة، avatars مرخصة أو شخصيات ذكاء اصطناعي أصلية.

أنشئ الفيديو الفيروسي التالي باستخدام Rekreate

ابحث عن فيديو قصير ناجح، أعد إنشاؤه باستخدام نصك، شخصيتك الافتراضية وصوتك، وأنشئ مشاهد باستخدام Seedance وKling وVeo في مكان عمل واحد.

ابدأ التجربة المجانية →

أدلة ذات صلة

المصادر

  1. OmniHuman 1.5 audio-driven digital human, Hedra
  2. OmniHuman 1.5 image and audio to video, RunComfy
  3. OmniHuman 1.5 explained, Vidmuse