Rekreate
Guide des modèles

OmniHuman : une photo + audio = une vidéo parlante

Comment fonctionne le modèle d'animation humaine piloté par audio de ByteDance, les améliorations d'OmniHuman 1.5 et son utilisation pour les avatars UGC.

Mis à jour Par Rekreate Editorial Team, Recherche vidéo AI
Sommaire Comment fonctionne OmniHumanVersions d'OmniHumanOmniHuman en brefOmniHuman vs autres approches d'avatarsConseils pour de meilleurs résultats avec OmniHumanQuestions fréquentes

OmniHuman est le modèle vidéo humain piloté par audio de ByteDance. Fournissez-lui une seule image d'une personne ou d'un personnage et une piste audio, et il génère une vidéo où le sujet parle ou chante avec une synchronisation labiale, des expressions faciales, des mouvements de tête et des gestes corporels naturels. Le modèle de recherche OmniHuman-1 a été dévoilé en février 2025, et OmniHuman 1.5, présenté en août 2025, a ajouté une compréhension sémantique de l'audio pour que les gestes et les émotions correspondent à ce qui est dit, et pas seulement au rythme.

Dans Rekreate, OmniHuman alimente les vidéos d'avatars pilotées par audio : vous fournissez un portrait, une piste vocale (par exemple une voix clonée) et une courte instruction.

Points clés
  • Entrée : une image (portrait, mi-corps ou plein corps) + audio + texte optionnel pour guider.
  • Sortie : vidéo parlante ou chantante synchronisée avec des gestes naturels.
  • OmniHuman-1 : février 2025 · OmniHuman 1.5 : août 2025 avec émotions et gestes planifiés par MLLM, clips jusqu'à ~30 s.
  • Idéal pour : têtes parlantes UGC, vidéos explicatives sans visage, dialogues de personnages, clips musicaux.
  • Dans Rekreate : image + audio + instruction, avec détection automatique du sujet à animer.

Comment fonctionne OmniHuman

Les outils de têtes parlantes précédents animaient principalement la région de la bouche d'un visage recadré. OmniHuman a été entraîné avec des "omni-conditions" — signaux audio, pose et texte mélangés pendant l'entraînement — ce qui lui permet d'animer n'importe quel cadrage : portraits rapprochés, plans mi-corps et plein corps, y compris les mains, les gestes et les interactions avec des objets.

OmniHuman 1.5 a introduit une conception à double système : un modèle de langage large multimodal interprète d'abord le sens et l'émotion de l'audio (et du texte optionnel), planifie les réactions et gestes appropriés, puis un transformer de diffusion rend le mouvement. Le résultat est une performance qui réagit au contenu — accentuation des mots clés, pauses, sourires sur une punchline — et peut suivre des instructions textuelles pour le contrôle de la caméra et des gestes.

Versions d'OmniHuman

Février 2025

OmniHuman-1

Article de recherche et démos montrant des vidéos humaines réalistes à partir d'une image et d'un audio, avec des cadrages portrait, mi-corps et plein corps, parlant et chantant, y compris des personnages dessinés et stylisés.

Août 2025

OmniHuman 1.5

Ajoute une planification sémantique basée sur MLLM pour des émotions et gestes contextuels, des instructions textuelles optionnelles pour la caméra et les gestes, des scènes multi-personnages et des vidéos plus longues et continues (jusqu'à environ 30 secondes sur les API courantes).

Les versions disponibles varient selon la plateforme ; ByteDance propose OmniHuman via BytePlus/Volcano Engine et son écosystème Dreamina/CapCut.

OmniHuman en bref

Développeur ByteDance (Intelligent Creation / OmniHuman Lab)
Entrées Image unique, piste audio, instruction textuelle optionnelle
Cadrages Portrait, mi-corps, plein corps ; personnages réalistes et stylisés
Mouvements Synchronisation labiale, expressions faciales, gestes de tête et du corps, certaines interactions avec des objets
Durée typique Jusqu'à ~30 s par génération (1.5, selon le fournisseur)
Dans Rekreate Image + audio + instruction ; détection automatique du sujet à animer

OmniHuman vs autres approches d'avatars

  • vs avatars studio (HeyGen, Synthesia) : ceux-ci utilisent des jumeaux numériques pré-entraînés enregistrés en vidéo ; OmniHuman anime n'importe quelle image unique, ce qui est plus rapide pour de nouveaux personnages mais moins contrôlable pour des scripts très longs.
  • vs Seedance 2.x dialogue : Seedance génère des scènes entières avec audio à partir d'instructions et de références ; OmniHuman est spécialisé pour faire parler une image spécifique avec une piste audio spécifique et une synchronisation labiale précise.
  • vs Kling Motion Control : Motion Control copie les mouvements d'une vidéo de référence ; OmniHuman invente les mouvements à partir de l'audio.

Pour l'UGC, une combinaison courante dans Rekreate est : recréer un script viral → générer la voix avec une voix clonée → animer un portrait avec OmniHuman → ajouter des plans d'illustration avec Seedance ou Veo → sous-titrer.

Conseils pour de meilleurs résultats avec OmniHuman

  1. Utilisez une image nette, de face avec la bouche visible et une expression neutre.
  2. Adaptez le cadrage au contenu : les images mi-corps permettent des gestes des mains ; les portraits serrés mettent l'accent sur les expressions faciales.
  3. Un audio propre (sans musique sous les paroles) donne la synchronisation labiale la plus précise.
  4. Restez naturel dans les dialogues — les scripts conversationnels avec des pauses s'animent mieux que des lectures rapides et monotones.
  5. Utilisez l'instruction pour guider : "parle chaleureusement, petits hochements de tête, gestes occasionnels des mains, caméra statique."
  6. Obtenez le consentement avant d'animer l'image d'une personne réelle, et étiquetez le contenu généré par AI lorsque les plateformes l'exigent.

Questions fréquentes

Qu'est-ce qu'OmniHuman ?

OmniHuman est le modèle AI de ByteDance qui génère une vidéo réaliste parlante ou chantante à partir d'une seule image et d'une piste audio, avec synchronisation labiale, expressions faciales et gestes corporels.

Quelle est la différence entre OmniHuman-1 et OmniHuman 1.5 ?

OmniHuman 1.5 (août 2025) ajoute un LLM multimodal qui comprend le sens et l'émotion de l'audio pour planifier les gestes et expressions, prend en charge des instructions textuelles pour la caméra et les gestes, et produit des vidéos plus longues et continues que OmniHuman-1 (février 2025).

Quelle est la durée maximale des vidéos OmniHuman ?

Les API OmniHuman 1.5 courantes génèrent des vidéos jusqu'à environ 30 secondes par exécution ; les limites dépendent du fournisseur.

OmniHuman peut-il animer des dessins animés ?

Oui. Il fonctionne avec des personnages stylisés, des dessins animés et des personnages d'anime ainsi qu'avec des portraits réalistes.

OmniHuman est-il disponible dans Rekreate ?

Oui. Rekreate utilise OmniHuman pour des vidéos d'avatars pilotées par audio : fournissez une image, une piste audio et une courte instruction.

Puis-je utiliser une photo de célébrité avec OmniHuman ?

Non. Animer des personnes réelles sans leur consentement peut enfreindre les règles des plateformes et les lois sur le droit à l'image. Utilisez votre propre image avec permission, des avatars sous licence ou des personnages AI originaux.

Créez votre prochaine vidéo virale avec Rekreate

Trouvez une vidéo courte qui a fait ses preuves, recréez-la avec votre script, avatar et voix, et générez des scènes avec Seedance, Kling et Veo dans un seul espace de travail.

Commencer l'essai gratuit →

Guides associés

Sources

  1. OmniHuman 1.5 audio-driven digital human, Hedra
  2. OmniHuman 1.5 image and audio to video, RunComfy
  3. OmniHuman 1.5 explained, Vidmuse