Rekreate
Модель нұсқаулығы

OmniHuman: бір фото + аудио = сөйлейтін бейне

ByteDance-тың аудио арқылы басқарылатын адам анимациясы моделі қалай жұмыс істейді, OmniHuman 1.5 қандай жақсартулар енгізді және оны UGC аватарлары үшін қалай қолдануға болады.

Жаңартылған Автор Rekreate Editorial Team, AI бейне зерттеулері
Мазмұны OmniHuman қалай жұмыс істейдіOmniHuman нұсқаларыOmniHuman қысқашаOmniHuman басқа аватар тәсілдерімен салыстыруOmniHuman нәтижелерін жақсарту бойынша кеңестерЖиі қойылатын сұрақтар

OmniHuman — ByteDance компаниясының аудио арқылы басқарылатын адам бейнесін жасауға арналған моделі. Бір адамның немесе кейіпкердің суретін және аудио тректі енгізсеңіз, ол ерін қимылына сәйкес сөйлейтін немесе ән айтатын, бет-әлпетінің мимикасы, бас пен дене қимылдары үйлескен бейне жасайды. OmniHuman-1 зерттеу моделі 2025 жылдың ақпанында таныстырылды, ал OmniHuman 1.5 2025 жылдың тамызында таныстырылып, аудионың семантикалық мағынасын түсініп, қимылдар мен эмоцияларды тек ырғаққа емес, айтылып жатқан мазмұнға сәйкес келтіретін мүмкіндіктер қосты.

Rekreate платформасында OmniHuman аудио арқылы басқарылатын аватар бейнелерін жасауға мүмкіндік береді: сіз портрет, дауыс трегі (мысалы, көшірілген дауыс) және қысқа бағыттаушы мәтін енгізесіз.

Негізгі тұжырымдар
  • Енгізу: бір сурет (портрет, жартылай дене немесе толық дене) + аудио + қосымша мәтіндік нұсқаулық.
  • Шығару: ерін қимылына сәйкес сөйлейтін немесе ән айтатын, табиғи қимылдары бар бейне.
  • OmniHuman-1: 2025 жылдың ақпаны · OmniHuman 1.5: 2025 жылдың тамызы, MLLM арқылы эмоциялар мен қимылдарды жоспарлау, ұзақтығы ~30 секундқа дейінгі клиптер.
  • Ең қолайлы: UGC сөйлейтін бас бейнелері, бетсіз түсіндірмелер, кейіпкер диалогтары, музыкалық клиптер.
  • Rekreate платформасында: сурет + аудио + мәтіндік нұсқаулық, сөйлейтін адамды автоматты түрде анықтау.

OmniHuman қалай жұмыс істейді

Бұрынғы сөйлейтін бас құралдары көбінесе бет аймағының ауыз бөлігін анимациялайтын. OmniHuman "омни-шарттар" — аудио, поза және мәтін сигналдарын араластырып оқыту арқылы кез келген кадрлауды анимациялай алады: жақын портреттер, жартылай дене және толық дене суреттері, соның ішінде қол қимылдары мен заттармен әрекеттесу.

OmniHuman 1.5 екі жүйелі дизайнды енгізді: мультимодальды үлкен тіл моделі алдымен аудионың (және қосымша мәтіннің) мағынасын және эмоциясын түсініп, сәйкес реакциялар мен қимылдарды жоспарлайды, содан кейін диффузиялық трансформер қозғалысты жасайды. Нәтижесінде мазмұнға жауап беретін орындау — негізгі сөздерге екпін, үзілістер, әзілге күлімдеу — және камера мен қимылдарды басқару үшін мәтіндік нұсқауларды орындау мүмкіндігі пайда болады.

OmniHuman нұсқалары

2025 жылдың ақпаны

OmniHuman-1

Бір сурет пен аудио арқылы портрет, жартылай дене және толық дене кадрларында, сөйлейтін және ән айтатын, соның ішінде мультфильмдер мен стильдендірілген кейіпкерлерді қамтитын шынайы адам бейнесін көрсететін зерттеу мақаласы мен демонстрациялар.

2025 жылдың тамызы

OmniHuman 1.5

MLLM негізіндегі семантикалық жоспарлау арқылы контекстке сәйкес эмоциялар мен қимылдарды қосады, камера мен қимылдарға арналған мәтіндік нұсқаулықтарды қолдайды, көп адамдық көріністер мен ұзақ, үздіксіз бейнелерді (ортақ API-ларда шамамен 30 секундқа дейін) жасайды.

Қол жетімді нұсқалар платформаға байланысты өзгереді; ByteDance OmniHuman-ды BytePlus/Volcano Engine және Dreamina/CapCut экожүйесі арқылы ұсынады.

OmniHuman қысқаша

Әзірлеуші ByteDance (Intelligent Creation / OmniHuman Lab)
Енгізулер Бір сурет, аудио трек, қосымша мәтіндік нұсқаулық
Кадрлау Портрет, жартылай дене, толық дене; шынайы және стильдендірілген кейіпкерлер
Қозғалыс Ерін қимылы, бет-әлпет мимикасы, бас пен дене қимылдары, кейбір заттармен әрекеттесу
Әдеттегі ұзақтық Әр генерацияға ~30 секундқа дейін (1.5, провайдерге байланысты)
Rekreate платформасында Сурет + аудио + мәтіндік нұсқаулық; анимацияланатын субъектіні автоматты түрде анықтау

OmniHuman басқа аватар тәсілдерімен салыстыру

  • vs студиялық аватарлар (HeyGen, Synthesia): олар алдын ала жазылған цифрлық егіздерді қолданады; OmniHuman кез келген бір суретті анимациялайды, бұл жаңа кейіпкерлер үшін жылдамырақ, бірақ ұзақ мәтіндер үшін аз басқарылатын.
  • vs Seedance 2.x диалогы: Seedance мәтіндік нұсқаулықтар мен сілтемелерден бүкіл көріністерді жасайды; OmniHuman нақты суретті нақты аудио трекпен ерін қимылына сәйкес сөйлетуге маманданған.
  • vs Kling Motion Control: Motion Control қозғалысты сілтеме бейнесінен көшіреді; OmniHuman қозғалысты аудиодан жасайды.

UGC үшін Rekreate платформасында жиі қолданылатын комбинация: вирустық сценарийді қайта жасау → көшірілген дауыспен дауыс жасау → портретті OmniHuman арқылы анимациялау → Seedance немесе Veo арқылы қосымша бейне қосу → субтитр қосу.

OmniHuman нәтижелерін жақсарту бойынша кеңестер

  1. Айқын, алдыңғы жақтан түсірілген суретті қолданыңыз, ауыз көрініп, бейтарап бет-әлпет болсын.
  2. Кадрлауды мазмұнға сәйкестендіріңіз: жартылай дене суреттері қол қимылдарын қосуға мүмкіндік береді; жақын портреттер бет-әлпет мимикасына назар аударады.
  3. Таза аудио (сөйлеу кезінде музыкасыз) ерін қимылына ең дәл сәйкестікті береді.
  4. Сценарийлерді табиғи ұстаңыз — үзілістері бар әңгімелесу стиліндегі мәтіндер монотонды жылдам оқуларға қарағанда жақсы анимацияланады.
  5. Бағыттау үшін мәтіндік нұсқаулықты қолданыңыз: "жылы сөйлейді, басын сәл иеді, кейде қол қимылдарын жасайды, камера статикалық."
  6. Шынайы адамның бейнесін анимацияламас бұрын рұқсат алыңыз және платформалар талап етсе, AI арқылы жасалған мазмұнды белгілеңіз.

Жиі қойылатын сұрақтар

OmniHuman дегеніміз не?

OmniHuman — ByteDance компаниясының AI моделі, бір сурет пен аудио трек арқылы ерін қимылы, бет-әлпет мимикасы және дене қимылдары үйлескен шынайы сөйлейтін немесе ән айтатын бейне жасайды.

OmniHuman-1 мен OmniHuman 1.5 арасындағы айырмашылық қандай?

OmniHuman 1.5 (2025 жылдың тамызы) аудионың мағынасы мен эмоциясын түсініп, қимылдар мен мимикаларды жоспарлайтын мультимодальды LLM қосады, камера мен қимылдарға арналған мәтіндік нұсқаулықтарды қолдайды және OmniHuman-1 (2025 жылдың ақпаны) қарағанда ұзақ, үздіксіз бейнелер жасайды.

OmniHuman бейнелері қанша уақытқа созылуы мүмкін?

OmniHuman 1.5 API-лары бір іске қосу кезінде шамамен 30 секундқа дейін бейнелер жасайды; шектеулер провайдерге байланысты.

OmniHuman мультфильмдерді анимациялай ала ма?

Иә. Ол стильдендірілген, мультфильм және аниме кейіпкерлерімен, сондай-ақ шынайы портреттермен жұмыс істейді.

OmniHuman Rekreate платформасында қолжетімді ме?

Иә. Rekreate платформасы OmniHuman-ды аудио арқылы басқарылатын аватар бейнелерін жасау үшін қолданады: сурет, аудио трек және қысқа мәтіндік нұсқаулық енгізіңіз.

OmniHuman-мен танымал адамның суретін қолдана аламын ба?

Жоқ. Шынайы адамдардың бейнесін рұқсатсыз анимациялау платформалардың ережелері мен бейнеге құқық туралы заңдарды бұзуы мүмкін. Өз суретіңізді рұқсатпен, лицензияланған аватарларды немесе түпнұсқа AI кейіпкерлерін қолданыңыз.

Келесі вирустық видеоңызды Rekreate арқылы жасаңыз

Дәлелденген қысқа видеоны табыңыз, оны өз сценарийіңізбен, аватарыңызбен және дауысыңызбен қайта жасаңыз, және Seedance, Kling және Veo арқылы көріністерді бір жұмыс кеңістігінде жасаңыз.

Тегін сынақ нұсқасын бастаңыз →

Қатысты нұсқаулықтар

Дереккөздер

  1. OmniHuman 1.5 audio-driven digital human, Hedra
  2. OmniHuman 1.5 image and audio to video, RunComfy
  3. OmniHuman 1.5 explained, Vidmuse