Rekreate
Przewodnik po modelach

OmniHuman: jedno zdjęcie + audio = mówiące wideo

Jak działa model animacji ludzkiej sterowany dźwiękiem od ByteDance, co poprawiono w OmniHuman 1.5 i jak go używać do awatarów UGC.

Zaktualizowano Autor Rekreate Editorial Team, Badania nad wideo AI
Spis treści Jak działa OmniHumanWersje OmniHumanOmniHuman w skrócieOmniHuman vs inne podejścia do awatarówWskazówki dla lepszych wyników z OmniHumanNajczęściej zadawane pytania

OmniHuman to model wideo sterowany dźwiękiem od ByteDance. Wystarczy jedno zdjęcie osoby lub postaci oraz ścieżka audio, aby wygenerować wideo, w którym obiekt mówi lub śpiewa z dopasowaną synchronizacją ruchu ust, mimiką, ruchem głowy i gestami ciała. Model badawczy OmniHuman-1 został zaprezentowany w lutym 2025 roku, a OmniHuman 1.5, zaprezentowany w sierpniu 2025 roku, dodał semantyczne rozumienie audio, dzięki czemu gesty i emocje odpowiadają temu, co jest mówione, a nie tylko rytmowi.

W Rekreate OmniHuman umożliwia tworzenie wideo awatarów sterowanych dźwiękiem: dostarcz portret, ścieżkę głosową (np. sklonowany głos) i krótki opis kierunkowy.

Kluczowe informacje
  • Wejście: jedno zdjęcie (portret, pół sylwetki lub cała sylwetka) + audio + opcjonalny tekst kierunkowy.
  • Wyjście: mówiące lub śpiewające wideo zsynchronizowane z naturalnymi gestami.
  • OmniHuman-1: luty 2025 · OmniHuman 1.5: sierpień 2025 z emocjami i gestami planowanymi przez MLLM, klipy do ~30 s.
  • Najlepsze do: mówiących głów UGC, anonimowych wyjaśnień, dialogów postaci, klipów muzycznych.
  • W Rekreate: zdjęcie + audio + opis kierunkowy, z automatycznym wykrywaniem obiektu mówiącego.

Jak działa OmniHuman

Wcześniejsze narzędzia do tworzenia mówiących głów animowały głównie obszar ust na przyciętej twarzy. OmniHuman został przeszkolony na „omni-warunkach” — mieszając sygnały audio, pozy i tekst podczas treningu — dzięki czemu może animować dowolne kadrowanie: portrety z bliska, pół sylwetki i całą sylwetkę, w tym dłonie, gesty i interakcje z obiektami.

OmniHuman 1.5 wprowadził projekt dwusystemowy: multimodalny duży model językowy najpierw interpretuje znaczenie i emocje audio (oraz opcjonalnego tekstu), planuje odpowiednie reakcje i gesty, a następnie transformer dyfuzyjny renderuje ruch. Rezultatem jest występ reagujący na treść — akcentowanie kluczowych słów, pauzy, uśmiechy na puencie — oraz możliwość podążania za instrukcjami tekstowymi dotyczącymi kamery i gestów.

Wersje OmniHuman

Luty 2025

OmniHuman-1

Artykuł badawczy i demonstracje pokazujące realistyczne wideo ludzkie z jednego zdjęcia i audio, w różnych kadrowaniach: portret, pół sylwetki i cała sylwetka, mówiące i śpiewające, w tym kreskówki i stylizowane postaci.

Sierpień 2025

OmniHuman 1.5

Dodaje semantyczne planowanie oparte na MLLM dla emocji i gestów uwzględniających kontekst, opcjonalne wskazówki tekstowe dla kamery i gestów, sceny wieloosobowe oraz dłuższe, bardziej ciągłe wideo (do około 30 sekund na popularnych API).

Dostępność wersji zależy od platformy; ByteDance oferuje OmniHuman przez BytePlus/Volcano Engine oraz ekosystem Dreamina/CapCut.

OmniHuman w skrócie

Twórca ByteDance (Intelligent Creation / OmniHuman Lab)
Wejścia Jedno zdjęcie, ścieżka audio, opcjonalny opis tekstowy
Kadrowania Portret, pół sylwetki, cała sylwetka; realistyczne i stylizowane postaci
Ruch Synchronizacja ruchu ust, mimika, gesty głowy i ciała, niektóre interakcje z obiektami
Typowa długość Do ~30 s na generację (1.5, zależne od dostawcy)
W Rekreate Zdjęcie + audio + opis; automatyczne wykrywanie obiektu do animacji

OmniHuman vs inne podejścia do awatarów

  • vs awatary studyjne (HeyGen, Synthesia): te wykorzystują wcześniej przeszkolone cyfrowe bliźniaki nagrane na wideo; OmniHuman animuje dowolne pojedyncze zdjęcie, co jest szybsze dla nowych postaci, ale mniej kontrolowalne przy bardzo długich skryptach.
  • vs Seedance 2.x dialog: Seedance generuje całe sceny z audio na podstawie opisów i referencji; OmniHuman specjalizuje się w sprawianiu, że konkretne zdjęcie mówi konkretną ścieżkę audio z precyzyjną synchronizacją ruchu ust.
  • vs Kling Motion Control: Motion Control kopiuje ruch z referencyjnego wideo; OmniHuman tworzy ruch na podstawie audio.

W przypadku UGC, popularne połączenie w Rekreate to: odtworzenie wiralowego skryptu → wygenerowanie głosu za pomocą sklonowanego głosu → animacja portretu za pomocą OmniHuman → dodanie b-rollu z Seedance lub Veo → dodanie napisów.

Wskazówki dla lepszych wyników z OmniHuman

  1. Użyj ostrego, frontalnego zdjęcia z widocznymi ustami i neutralnym wyrazem twarzy.
  2. Dopasuj kadrowanie do treści: zdjęcia pół sylwetki pozwalają na gesty dłoni; ciasne portrety skupiają się na mimice.
  3. Czyste audio (bez muzyki pod mową) zapewnia najdokładniejszą synchronizację ruchu ust.
  4. Twórz naturalne linie dialogowe — skrypty konwersacyjne z pauzami animują się lepiej niż szybkie monotonne czytanie.
  5. Użyj opisu kierunkowego: „mówi ciepło, małe kiwnięcia głową, okazjonalne gesty dłoni, statyczna kamera.”
  6. Uzyskaj zgodę przed animowaniem wizerunku prawdziwej osoby i oznacz treści generowane przez AI tam, gdzie wymagają tego platformy.

Najczęściej zadawane pytania

Co to jest OmniHuman?

OmniHuman to model AI od ByteDance, który generuje realistyczne mówiące lub śpiewające wideo z jednego zdjęcia i ścieżki audio, z synchronizacją ruchu ust, mimiką i gestami ciała.

Jaka jest różnica między OmniHuman-1 a OmniHuman 1.5?

OmniHuman 1.5 (sierpień 2025) dodaje multimodalny LLM, który rozumie znaczenie i emocje audio, aby zaplanować gesty i mimikę, obsługuje wskazówki tekstowe dla kamery i gestów oraz generuje dłuższe, bardziej ciągłe wideo niż OmniHuman-1 (luty 2025).

Jak długie mogą być wideo OmniHuman?

Popularne API OmniHuman 1.5 generują wideo do około 30 sekund na sesję; limity zależą od dostawcy.

Czy OmniHuman może animować kreskówki?

Tak. Działa z postaciami stylizowanymi, kreskówkowymi i anime, jak również z realistycznymi portretami.

Czy OmniHuman jest dostępny w Rekreate?

Tak. Rekreate wykorzystuje OmniHuman do wideo awatarów sterowanych dźwiękiem: dostarcz zdjęcie, ścieżkę audio i krótki opis.

Czy mogę użyć zdjęcia celebryty z OmniHuman?

Nie. Animowanie prawdziwych osób bez zgody może naruszać zasady platform i prawa dotyczące wizerunku. Używaj własnych zdjęć za zgodą, licencjonowanych awatarów lub oryginalnych postaci AI.

Stwórz swoje kolejne viralowe wideo z Rekreate

Znajdź sprawdzone wideo krótkiego formatu, odtwórz je ze swoim skryptem, awatarem i głosem, a sceny wygeneruj za pomocą Seedance, Kling i Veo w jednym miejscu.

Rozpocznij darmowy okres próbny →

Powiązane przewodniki

Źródła

  1. OmniHuman 1.5 audio-driven digital human, Hedra
  2. OmniHuman 1.5 image and audio to video, RunComfy
  3. OmniHuman 1.5 explained, Vidmuse