Spis treści
Jak działa OmniHumanWersje OmniHumanOmniHuman w skrócieOmniHuman vs inne podejścia do awatarówWskazówki dla lepszych wyników z OmniHumanNajczęściej zadawane pytaniaOmniHuman to model wideo sterowany dźwiękiem od ByteDance. Wystarczy jedno zdjęcie osoby lub postaci oraz ścieżka audio, aby wygenerować wideo, w którym obiekt mówi lub śpiewa z dopasowaną synchronizacją ruchu ust, mimiką, ruchem głowy i gestami ciała. Model badawczy OmniHuman-1 został zaprezentowany w lutym 2025 roku, a OmniHuman 1.5, zaprezentowany w sierpniu 2025 roku, dodał semantyczne rozumienie audio, dzięki czemu gesty i emocje odpowiadają temu, co jest mówione, a nie tylko rytmowi.
W Rekreate OmniHuman umożliwia tworzenie wideo awatarów sterowanych dźwiękiem: dostarcz portret, ścieżkę głosową (np. sklonowany głos) i krótki opis kierunkowy.
- Wejście: jedno zdjęcie (portret, pół sylwetki lub cała sylwetka) + audio + opcjonalny tekst kierunkowy.
- Wyjście: mówiące lub śpiewające wideo zsynchronizowane z naturalnymi gestami.
- OmniHuman-1: luty 2025 · OmniHuman 1.5: sierpień 2025 z emocjami i gestami planowanymi przez MLLM, klipy do ~30 s.
- Najlepsze do: mówiących głów UGC, anonimowych wyjaśnień, dialogów postaci, klipów muzycznych.
- W Rekreate: zdjęcie + audio + opis kierunkowy, z automatycznym wykrywaniem obiektu mówiącego.
Jak działa OmniHuman
Wcześniejsze narzędzia do tworzenia mówiących głów animowały głównie obszar ust na przyciętej twarzy. OmniHuman został przeszkolony na „omni-warunkach” — mieszając sygnały audio, pozy i tekst podczas treningu — dzięki czemu może animować dowolne kadrowanie: portrety z bliska, pół sylwetki i całą sylwetkę, w tym dłonie, gesty i interakcje z obiektami.
OmniHuman 1.5 wprowadził projekt dwusystemowy: multimodalny duży model językowy najpierw interpretuje znaczenie i emocje audio (oraz opcjonalnego tekstu), planuje odpowiednie reakcje i gesty, a następnie transformer dyfuzyjny renderuje ruch. Rezultatem jest występ reagujący na treść — akcentowanie kluczowych słów, pauzy, uśmiechy na puencie — oraz możliwość podążania za instrukcjami tekstowymi dotyczącymi kamery i gestów.
Wersje OmniHuman
OmniHuman-1
Artykuł badawczy i demonstracje pokazujące realistyczne wideo ludzkie z jednego zdjęcia i audio, w różnych kadrowaniach: portret, pół sylwetki i cała sylwetka, mówiące i śpiewające, w tym kreskówki i stylizowane postaci.
OmniHuman 1.5
Dodaje semantyczne planowanie oparte na MLLM dla emocji i gestów uwzględniających kontekst, opcjonalne wskazówki tekstowe dla kamery i gestów, sceny wieloosobowe oraz dłuższe, bardziej ciągłe wideo (do około 30 sekund na popularnych API).
Dostępność wersji zależy od platformy; ByteDance oferuje OmniHuman przez BytePlus/Volcano Engine oraz ekosystem Dreamina/CapCut.
OmniHuman w skrócie
| Twórca | ByteDance (Intelligent Creation / OmniHuman Lab) |
|---|---|
| Wejścia | Jedno zdjęcie, ścieżka audio, opcjonalny opis tekstowy |
| Kadrowania | Portret, pół sylwetki, cała sylwetka; realistyczne i stylizowane postaci |
| Ruch | Synchronizacja ruchu ust, mimika, gesty głowy i ciała, niektóre interakcje z obiektami |
| Typowa długość | Do ~30 s na generację (1.5, zależne od dostawcy) |
| W Rekreate | Zdjęcie + audio + opis; automatyczne wykrywanie obiektu do animacji |
OmniHuman vs inne podejścia do awatarów
- vs awatary studyjne (HeyGen, Synthesia): te wykorzystują wcześniej przeszkolone cyfrowe bliźniaki nagrane na wideo; OmniHuman animuje dowolne pojedyncze zdjęcie, co jest szybsze dla nowych postaci, ale mniej kontrolowalne przy bardzo długich skryptach.
- vs Seedance 2.x dialog: Seedance generuje całe sceny z audio na podstawie opisów i referencji; OmniHuman specjalizuje się w sprawianiu, że konkretne zdjęcie mówi konkretną ścieżkę audio z precyzyjną synchronizacją ruchu ust.
- vs Kling Motion Control: Motion Control kopiuje ruch z referencyjnego wideo; OmniHuman tworzy ruch na podstawie audio.
W przypadku UGC, popularne połączenie w Rekreate to: odtworzenie wiralowego skryptu → wygenerowanie głosu za pomocą sklonowanego głosu → animacja portretu za pomocą OmniHuman → dodanie b-rollu z Seedance lub Veo → dodanie napisów.
Wskazówki dla lepszych wyników z OmniHuman
- Użyj ostrego, frontalnego zdjęcia z widocznymi ustami i neutralnym wyrazem twarzy.
- Dopasuj kadrowanie do treści: zdjęcia pół sylwetki pozwalają na gesty dłoni; ciasne portrety skupiają się na mimice.
- Czyste audio (bez muzyki pod mową) zapewnia najdokładniejszą synchronizację ruchu ust.
- Twórz naturalne linie dialogowe — skrypty konwersacyjne z pauzami animują się lepiej niż szybkie monotonne czytanie.
- Użyj opisu kierunkowego: „mówi ciepło, małe kiwnięcia głową, okazjonalne gesty dłoni, statyczna kamera.”
- Uzyskaj zgodę przed animowaniem wizerunku prawdziwej osoby i oznacz treści generowane przez AI tam, gdzie wymagają tego platformy.
Najczęściej zadawane pytania
Co to jest OmniHuman?
OmniHuman to model AI od ByteDance, który generuje realistyczne mówiące lub śpiewające wideo z jednego zdjęcia i ścieżki audio, z synchronizacją ruchu ust, mimiką i gestami ciała.
Jaka jest różnica między OmniHuman-1 a OmniHuman 1.5?
OmniHuman 1.5 (sierpień 2025) dodaje multimodalny LLM, który rozumie znaczenie i emocje audio, aby zaplanować gesty i mimikę, obsługuje wskazówki tekstowe dla kamery i gestów oraz generuje dłuższe, bardziej ciągłe wideo niż OmniHuman-1 (luty 2025).
Jak długie mogą być wideo OmniHuman?
Popularne API OmniHuman 1.5 generują wideo do około 30 sekund na sesję; limity zależą od dostawcy.
Czy OmniHuman może animować kreskówki?
Tak. Działa z postaciami stylizowanymi, kreskówkowymi i anime, jak również z realistycznymi portretami.
Czy OmniHuman jest dostępny w Rekreate?
Tak. Rekreate wykorzystuje OmniHuman do wideo awatarów sterowanych dźwiękiem: dostarcz zdjęcie, ścieżkę audio i krótki opis.
Czy mogę użyć zdjęcia celebryty z OmniHuman?
Nie. Animowanie prawdziwych osób bez zgody może naruszać zasady platform i prawa dotyczące wizerunku. Używaj własnych zdjęć za zgodą, licencjonowanych awatarów lub oryginalnych postaci AI.
Stwórz swoje kolejne viralowe wideo z Rekreate
Znajdź sprawdzone wideo krótkiego formatu, odtwórz je ze swoim skryptem, awatarem i głosem, a sceny wygeneruj za pomocą Seedance, Kling i Veo w jednym miejscu.
Rozpocznij darmowy okres próbny →