Rekreate
Guia de modelos

OmniHuman: uma foto + áudio = um vídeo falante

Como funciona o modelo de animação humana guiado por áudio da ByteDance, o que o OmniHuman 1.5 melhorou e como usá-lo para avatares UGC.

Atualizado Por Rekreate Editorial Team, Pesquisa em vídeo AI
Conteúdo Como funciona o OmniHumanVersões do OmniHumanOmniHuman em resumoOmniHuman vs outras abordagens de avatarDicas para melhores resultados com OmniHumanPerguntas frequentes

OmniHuman é o modelo de vídeo humano guiado por áudio da ByteDance. Forneça uma única imagem de uma pessoa ou personagem e uma faixa de áudio, e ele gera um vídeo onde o sujeito fala ou canta com sincronização labial, expressões faciais, movimentos da cabeça e gestos corporais correspondentes. O modelo de pesquisa OmniHuman-1 foi lançado em fevereiro de 2025, e o OmniHuman 1.5, lançado em agosto de 2025, adicionou compreensão semântica do áudio para que gestos e emoções correspondam ao conteúdo falado, não apenas ao ritmo.

No Rekreate, OmniHuman alimenta vídeos de avatares guiados por áudio: você fornece um retrato, uma faixa de voz (por exemplo, uma voz clonada) e um breve prompt orientador.

Principais pontos
  • Entrada: uma imagem (retrato, meio corpo ou corpo inteiro) + áudio + texto opcional para orientação.
  • Saída: vídeo falante ou cantando com sincronização labial e gestos naturais.
  • OmniHuman-1: fevereiro de 2025 · OmniHuman 1.5: agosto de 2025 com emoções e gestos planejados por MLLM, clipes de até ~30 s.
  • Melhor para: cabeças falantes UGC, explicadores sem rosto, diálogos de personagens, clipes musicais.
  • No Rekreate: imagem + áudio + prompt, com detecção automática do sujeito falante.

Como funciona o OmniHuman

Ferramentas anteriores de cabeças falantes geralmente animavam apenas a região da boca de um rosto recortado. OmniHuman foi treinado com "omni-condições" — áudio, pose e sinais de texto misturados durante o treinamento — para que possa animar qualquer enquadramento: retratos em close, imagens de meio corpo e corpo inteiro, incluindo mãos, gestos e interações com objetos.

OmniHuman 1.5 introduziu um design de sistema duplo: um modelo de linguagem grande multimodal primeiro interpreta o significado e a emoção do áudio (e texto opcional), planeja reações e gestos apropriados, e então um transformador de difusão renderiza o movimento. O resultado é uma performance que reage ao conteúdo — ênfase em palavras-chave, pausas, sorrisos em uma punchline — e pode seguir instruções de texto para controle de câmera e gestos.

Versões do OmniHuman

Fevereiro de 2025

OmniHuman-1

Artigo de pesquisa e demos mostrando vídeos humanos realistas a partir de uma imagem mais áudio, em enquadramentos de retrato, meio corpo e corpo inteiro, falando e cantando, incluindo desenhos animados e personagens estilizados.

Agosto de 2025

OmniHuman 1.5

Adiciona planejamento semântico baseado em MLLM para emoções e gestos contextuais, orientação opcional por texto para câmera e gestos, cenas com múltiplas pessoas e vídeos mais longos e contínuos (até cerca de 30 segundos em APIs comuns).

As versões disponíveis variam por plataforma; a ByteDance oferece OmniHuman através do BytePlus/Volcano Engine e do ecossistema Dreamina/CapCut.

OmniHuman em resumo

Desenvolvedor ByteDance (Intelligent Creation / OmniHuman Lab)
Entradas Imagem única, faixa de áudio, prompt de texto opcional
Enquadramentos Retrato, meio corpo, corpo inteiro; personagens realistas e estilizados
Movimento Sincronização labial, expressões faciais, gestos da cabeça e do corpo, alguma interação com objetos
Duração típica Até ~30 s por geração (1.5, dependendo do provedor)
No Rekreate Imagem + áudio + prompt; detecção automática do sujeito a ser animado

OmniHuman vs outras abordagens de avatar

  • vs avatares de estúdio (HeyGen, Synthesia): esses usam gêmeos digitais pré-treinados gravados em vídeo; OmniHuman anima qualquer imagem única, o que é mais rápido para novos personagens, mas menos controlável para roteiros muito longos.
  • vs Seedance 2.x diálogo: Seedance gera cenas inteiras com áudio a partir de prompts e referências; OmniHuman é especializado em fazer uma imagem específica falar um áudio específico com sincronização labial precisa.
  • vs Kling Motion Control: Motion Control copia movimentos de um vídeo de referência; OmniHuman inventa movimentos a partir de áudio.

Para UGC, uma combinação comum no Rekreate é: recriar um roteiro viral → gerar a voz com uma voz clonada → animar um retrato com OmniHuman → adicionar b-roll do Seedance ou Veo → legendar.

Dicas para melhores resultados com OmniHuman

  1. Use uma imagem nítida e de frente com a boca visível e expressão neutra.
  2. Combine o enquadramento ao conteúdo: imagens de meio corpo permitem gestos com as mãos; retratos fechados focam na expressão facial.
  3. Áudio limpo (sem música sob a fala) oferece a sincronização labial mais precisa.
  4. Mantenha as falas naturais — roteiros conversacionais com pausas animam melhor do que leituras rápidas e monótonas.
  5. Use o prompt para direção: "fala calorosamente, pequenos acenos, gestos ocasionais com as mãos, câmera estática."
  6. Obtenha consentimento antes de animar a imagem de uma pessoa real e rotule o conteúdo gerado por AI onde as plataformas exigirem.

Perguntas frequentes

O que é OmniHuman?

OmniHuman é o modelo de AI da ByteDance que gera um vídeo realista falante ou cantando a partir de uma única imagem e uma faixa de áudio, com sincronização labial, expressões faciais e gestos corporais.

Qual é a diferença entre OmniHuman-1 e OmniHuman 1.5?

OmniHuman 1.5 (agosto de 2025) adiciona um LLM multimodal que entende o significado e a emoção do áudio para planejar gestos e expressões, suporta orientação por texto para câmera e gestos, e produz vídeos mais longos e contínuos do que o OmniHuman-1 (fevereiro de 2025).

Qual é a duração máxima dos vídeos OmniHuman?

APIs comuns do OmniHuman 1.5 geram vídeos de até cerca de 30 segundos por execução; os limites dependem do provedor.

OmniHuman pode animar desenhos animados?

Sim. Funciona com personagens estilizados, desenhos animados e anime, além de retratos realistas.

OmniHuman está disponível no Rekreate?

Sim. O Rekreate usa OmniHuman para vídeos de avatares guiados por áudio: forneça uma imagem, uma faixa de áudio e um breve prompt.

Posso usar uma foto de celebridade com OmniHuman?

Não. Animar pessoas reais sem consentimento pode violar regras de plataformas e leis sobre imagem. Use sua própria imagem com permissão, avatares licenciados ou personagens originais gerados por AI.

Crie seu próximo vídeo viral com Rekreate

Encontre um vídeo curto comprovado, recrie-o com seu roteiro, avatar e voz, e gere cenas com Seedance, Kling e Veo em um único espaço de trabalho.

Iniciar teste gratuito →

Guias relacionados

Fontes

  1. OmniHuman 1.5 audio-driven digital human, Hedra
  2. OmniHuman 1.5 image and audio to video, RunComfy
  3. OmniHuman 1.5 explained, Vidmuse