Inhalt
Wie OmniHuman funktioniertOmniHuman-VersionenOmniHuman auf einen BlickOmniHuman vs. andere Avatar-AnsätzeTipps für bessere OmniHuman-ErgebnisseHäufig gestellte FragenOmniHuman ist das audio-gesteuerte menschliche Videomodell von ByteDance. Geben Sie ihm ein einzelnes Bild einer Person oder Figur und eine Audiospur, und es erstellt ein Video, in dem das Subjekt mit passender Lippensynchronisation, Gesichtsausdrücken, Kopfbewegungen und Gesten spricht oder singt. Das Forschungsmodell OmniHuman-1 wurde im Februar 2025 vorgestellt, und OmniHuman 1.5, das im August 2025 veröffentlicht wurde, fügte eine semantische Audioverarbeitung hinzu, sodass Gesten und Emotionen nicht nur dem Rhythmus, sondern auch dem Inhalt des Gesagten entsprechen.
In Rekreate treibt OmniHuman audio-gesteuerte Avatar-Videos an: Sie liefern ein Porträt, eine Sprachspur (z. B. eine geklonte Stimme) und eine kurze Anweisung.
- Eingabe: ein Bild (Porträt, Halb- oder Ganzkörper) + Audio + optionaler Textleitfaden.
- Ausgabe: lippensynchrones sprechendes oder singendes Video mit natürlichen Gesten.
- OmniHuman-1: Februar 2025 · OmniHuman 1.5: August 2025 mit MLLM-geplanten Emotionen und Gesten, Clips bis zu ~30 s.
- Ideal für: UGC-Sprechköpfe, erklärende Videos ohne Gesicht, Charakterdialoge, Musikclips.
- In Rekreate: Bild + Audio + Anweisung, mit automatischer Erkennung des sprechenden Subjekts.
Wie OmniHuman funktioniert
Frühere Tools für sprechende Köpfe animierten meist nur den Mundbereich eines zugeschnittenen Gesichts. OmniHuman wurde mit „omni-conditions“ trainiert – einer Mischung aus Audio-, Pose- und Textsignalen während des Trainings – und kann daher jede Bildkomposition animieren: Nahporträts, Halb- und Ganzkörperaufnahmen, einschließlich Hände, Gesten und Interaktionen mit Objekten.
OmniHuman 1.5 führte ein zweistufiges System ein: Ein multimodales großes Sprachmodell interpretiert zunächst die Bedeutung und Emotion der Audiospur (und optionalen Texte), plant passende Reaktionen und Gesten, und ein Diffusion Transformer rendert die Bewegungen. Das Ergebnis ist eine Performance, die auf Inhalte reagiert – Betonung von Schlüsselwörtern, Pausen, Lächeln bei einer Pointe – und Textanweisungen für Kamera- und Gestensteuerung folgen kann.
OmniHuman-Versionen
OmniHuman-1
Forschungsarbeit und Demos, die realistische menschliche Videos aus einem Bild plus Audio zeigen, in Porträt-, Halb- und Ganzkörperaufnahmen, sprechend und singend, einschließlich Cartoons und stilisierter Charaktere.
OmniHuman 1.5
Fügt MLLM-basierte semantische Planung für kontextbewusste Emotionen und Gesten hinzu, optionale Textanweisungen für Kamera und Gesten, Mehrpersonen-Szenen und längere, kontinuierlichere Videos (bis zu etwa 30 Sekunden auf gängigen APIs).
Verfügbare Versionen variieren je nach Plattform; ByteDance bietet OmniHuman über BytePlus/Volcano Engine und das Dreamina/CapCut-Ökosystem an.
OmniHuman auf einen Blick
| Entwickler | ByteDance (Intelligent Creation / OmniHuman Lab) |
|---|---|
| Eingaben | Einzelbild, Audiospur, optionaler Textleitfaden |
| Bildkompositionen | Porträt, Halb- und Ganzkörper; realistische und stilisierte Charaktere |
| Bewegung | Lippensynchronisation, Gesichtsausdrücke, Kopf- und Körpergesten, einige Objektinteraktionen |
| Typische Länge | Bis zu ~30 s pro Generierung (1.5, abhängig vom Anbieter) |
| In Rekreate | Bild + Audio + Anweisung; automatische Erkennung des zu animierenden Subjekts |
OmniHuman vs. andere Avatar-Ansätze
- vs. Studio-Avatare (HeyGen, Synthesia): Diese nutzen vorab aufgezeichnete digitale Zwillinge; OmniHuman animiert jedes Einzelbild, was schneller für neue Charaktere ist, aber weniger Kontrolle bei sehr langen Skripten bietet.
- vs. Seedance 2.x Dialog: Seedance generiert ganze Szenen mit Audio aus Anweisungen und Referenzen; OmniHuman ist darauf spezialisiert, ein bestimmtes Bild mit einer bestimmten Audiospur lippensynchron sprechen zu lassen.
- vs. Kling Motion Control: Motion Control kopiert Bewegungen aus einem Referenz-Video; OmniHuman erfindet Bewegungen aus Audio.
Für UGC ist eine gängige Kombination in Rekreate: ein virales Skript nachstellen → die Stimme mit einer geklonten Stimme generieren → ein Porträt mit OmniHuman animieren → B-Roll von Seedance oder Veo hinzufügen → untertiteln.
Tipps für bessere OmniHuman-Ergebnisse
- Verwenden Sie ein scharfes, frontales Bild mit sichtbarem Mund und neutralem Ausdruck.
- Passen Sie die Bildkomposition an den Inhalt an: Halbkörperbilder ermöglichen Handgesten; enge Porträts fokussieren auf Gesichtsausdrücke.
- Sauberes Audio (ohne Musik unter der Sprache) sorgt für die genaueste Lippensynchronisation.
- Halten Sie die Texte natürlich – gesprächsartige Skripte mit Pausen animieren besser als schnelle monotone Lesungen.
- Nutzen Sie die Anweisung für Richtungen: „spricht warm, kleine Nicken, gelegentliche Handgesten, statische Kamera.“
- Holen Sie Zustimmung ein, bevor Sie das Abbild einer echten Person animieren, und kennzeichnen Sie KI-generierte Inhalte, wo Plattformen dies verlangen.
Häufig gestellte Fragen
Was ist OmniHuman?
OmniHuman ist das KI-Modell von ByteDance, das ein realistisches sprechendes oder singendes Video aus einem Einzelbild und einer Audiospur generiert, mit Lippensynchronisation, Gesichtsausdrücken und Körpergesten.
Was ist der Unterschied zwischen OmniHuman-1 und OmniHuman 1.5?
OmniHuman 1.5 (August 2025) fügt ein multimodales LLM hinzu, das die Bedeutung und Emotion der Audiospur versteht, um Gesten und Ausdrücke zu planen, unterstützt Textanweisungen für Kamera und Gesten und erstellt längere, kontinuierlichere Videos als OmniHuman-1 (Februar 2025).
Wie lang können OmniHuman-Videos sein?
Gängige OmniHuman 1.5 APIs generieren Videos bis zu etwa 30 Sekunden pro Durchlauf; die Grenzen hängen vom Anbieter ab.
Kann OmniHuman Cartoons animieren?
Ja. Es funktioniert mit stilisierten, Cartoon- und Anime-Charakteren sowie mit realistischen Porträts.
Ist OmniHuman in Rekreate verfügbar?
Ja. Rekreate nutzt OmniHuman für audio-gesteuerte Avatar-Videos: Geben Sie ein Bild, eine Audiospur und eine kurze Anweisung an.
Kann ich ein Promi-Foto mit OmniHuman verwenden?
Nein. Das Animieren realer Personen ohne Zustimmung kann gegen Plattformregeln und Gesetze zur Abbildung verstoßen. Verwenden Sie Ihr eigenes Bild mit Erlaubnis, lizenzierte Avatare oder originale KI-Charaktere.
Erstelle dein nächstes virales Video mit Rekreate
Finde ein bewährtes Kurzvideo, erstelle es neu mit deinem Skript, Avatar und deiner Stimme und generiere Szenen mit Seedance, Kling und Veo in einem Arbeitsbereich.
Kostenlose Testversion starten →