Contenido
Cómo funciona OmniHumanVersiones de OmniHumanOmniHuman en resumenOmniHuman frente a otros enfoques de avataresConsejos para mejores resultados con OmniHumanPreguntas frecuentesOmniHuman es el modelo de video humano impulsado por audio de ByteDance. Proporciona una sola imagen de una persona o personaje y una pista de audio, y genera un video donde el sujeto habla o canta con sincronización labial, expresiones faciales, movimientos de cabeza y gestos corporales. El modelo de investigación OmniHuman-1 se presentó en febrero de 2025, y OmniHuman 1.5, lanzado en agosto de 2025, añadió comprensión semántica del audio para que los gestos y emociones coincidan con lo que se dice, no solo con el ritmo.
En Rekreate, OmniHuman potencia los videos de avatares impulsados por audio: proporcionas un retrato, una pista de voz (por ejemplo, una voz clonada) y un breve prompt de orientación.
- Entrada: una imagen (retrato, medio cuerpo o cuerpo completo) + audio + texto opcional como guía.
- Salida: video hablado o cantado con sincronización labial y gestos naturales.
- OmniHuman-1: febrero de 2025 · OmniHuman 1.5: agosto de 2025 con emociones y gestos planificados por MLLM, clips de hasta ~30 s.
- Ideal para: cabezas parlantes UGC, explicadores sin rostro, diálogos de personajes, clips musicales.
- En Rekreate: imagen + audio + prompt, con detección automática del sujeto que habla.
Cómo funciona OmniHuman
Las herramientas anteriores para cabezas parlantes generalmente animaban solo la región de la boca de un rostro recortado. OmniHuman fue entrenado con "omni-condiciones" — audio, pose y señales de texto mezcladas durante el entrenamiento — para animar cualquier encuadre: retratos en primer plano, tomas de medio cuerpo y cuerpo completo, incluyendo manos, gestos e interacciones con objetos.
OmniHuman 1.5 introdujo un diseño de sistema dual: un modelo de lenguaje grande multimodal primero interpreta el significado y la emoción del audio (y texto opcional), planifica reacciones y gestos apropiados, y luego un transformador de difusión genera el movimiento. El resultado es una actuación que reacciona al contenido — énfasis en palabras clave, pausas, sonrisas en un remate — y puede seguir instrucciones de texto para control de cámara y gestos.
Versiones de OmniHuman
OmniHuman-1
Artículo de investigación y demos que muestran videos humanos realistas a partir de una imagen más audio, en encuadres de retrato, medio cuerpo y cuerpo completo, hablando y cantando, incluyendo dibujos animados y personajes estilizados.
OmniHuman 1.5
Añade planificación semántica basada en MLLM para emociones y gestos contextuales, guía opcional de texto para cámara y gestos, escenas con múltiples personas y videos más largos y continuos (hasta alrededor de 30 segundos en APIs comunes).
Las versiones disponibles varían según la plataforma; ByteDance ofrece OmniHuman a través de BytePlus/Volcano Engine y su ecosistema Dreamina/CapCut.
OmniHuman en resumen
| Desarrollador | ByteDance (Intelligent Creation / OmniHuman Lab) |
|---|---|
| Entradas | Imagen única, pista de audio, prompt de texto opcional |
| Encuadres | Retrato, medio cuerpo, cuerpo completo; personajes realistas y estilizados |
| Movimiento | Sincronización labial, expresiones faciales, gestos de cabeza y cuerpo, cierta interacción con objetos |
| Duración típica | Hasta ~30 s por generación (1.5, según el proveedor) |
| En Rekreate | Imagen + audio + prompt; detección automática del sujeto a animar |
OmniHuman frente a otros enfoques de avatares
- vs avatares de estudio (HeyGen, Synthesia): estos usan gemelos digitales preentrenados grabados en video; OmniHuman anima cualquier imagen única, lo que es más rápido para nuevos personajes pero menos controlable para guiones muy largos.
- vs Seedance 2.x diálogo: Seedance genera escenas completas con audio a partir de prompts y referencias; OmniHuman está especializado en hacer que una imagen específica hable una pista de audio específica con sincronización labial precisa.
- vs Kling Motion Control: Motion Control copia el movimiento de un video de referencia; OmniHuman inventa movimiento a partir de audio.
Para UGC, una combinación común en Rekreate es: recrear un guion viral → generar la voz con una voz clonada → animar un retrato con OmniHuman → añadir tomas adicionales con Seedance o Veo → subtitular.
Consejos para mejores resultados con OmniHuman
- Usa una imagen nítida y frontal con la boca visible y expresión neutral.
- Ajusta el encuadre al contenido: imágenes de medio cuerpo permiten gestos con las manos; retratos cerrados se centran en la expresión facial.
- Audio limpio (sin música bajo el discurso) ofrece la sincronización labial más precisa.
- Mantén las líneas naturales — guiones conversacionales con pausas se animan mejor que lecturas rápidas y monótonas.
- Usa el prompt para dirección: "habla cálidamente, pequeños movimientos de cabeza, gestos ocasionales con las manos, cámara estática."
- Obtén consentimiento antes de animar la imagen de una persona real, y etiqueta el contenido generado por AI donde las plataformas lo requieran.
Preguntas frecuentes
¿Qué es OmniHuman?
OmniHuman es el modelo AI de ByteDance que genera un video realista hablado o cantado a partir de una imagen única y una pista de audio, con sincronización labial, expresiones faciales y gestos corporales.
¿Cuál es la diferencia entre OmniHuman-1 y OmniHuman 1.5?
OmniHuman 1.5 (agosto de 2025) añade un LLM multimodal que entiende el significado y la emoción del audio para planificar gestos y expresiones, admite guía de texto para cámara y gestos, y produce videos más largos y continuos que OmniHuman-1 (febrero de 2025).
¿Cuánto pueden durar los videos de OmniHuman?
Las APIs comunes de OmniHuman 1.5 generan videos de hasta alrededor de 30 segundos por ejecución; los límites dependen del proveedor.
¿Puede OmniHuman animar dibujos animados?
Sí. Funciona con personajes estilizados, dibujos animados y anime, así como retratos realistas.
¿Está disponible OmniHuman en Rekreate?
Sí. Rekreate utiliza OmniHuman para videos de avatares impulsados por audio: proporciona una imagen, una pista de audio y un breve prompt.
¿Puedo usar una foto de un famoso con OmniHuman?
No. Animar personas reales sin consentimiento puede violar las reglas de las plataformas y las leyes sobre la imagen personal. Usa tu propia imagen con permiso, avatares licenciados o personajes originales generados por AI.
Crea tu próximo video viral con Rekreate
Encuentra un video corto probado, recréalo con tu guion, avatar y voz, y genera escenas con Seedance, Kling y Veo en un solo espacio de trabajo.
Comienza la prueba gratuita →