Conteúdo
Como funciona o OmniHumanVersões do OmniHumanOmniHuman em resumoOmniHuman vs outras abordagens de avatarDicas para melhores resultados com OmniHumanPerguntas frequentesOmniHuman é o modelo de vídeo humano guiado por áudio da ByteDance. Forneça uma única imagem de uma pessoa ou personagem e uma faixa de áudio, e ele gera um vídeo onde o sujeito fala ou canta com sincronização labial, expressões faciais, movimentos da cabeça e gestos corporais correspondentes. O modelo de pesquisa OmniHuman-1 foi lançado em fevereiro de 2025, e o OmniHuman 1.5, lançado em agosto de 2025, adicionou compreensão semântica do áudio para que gestos e emoções correspondam ao conteúdo falado, não apenas ao ritmo.
No Rekreate, OmniHuman alimenta vídeos de avatares guiados por áudio: você fornece um retrato, uma faixa de voz (por exemplo, uma voz clonada) e um breve prompt orientador.
- Entrada: uma imagem (retrato, meio corpo ou corpo inteiro) + áudio + texto opcional para orientação.
- Saída: vídeo falante ou cantando com sincronização labial e gestos naturais.
- OmniHuman-1: fevereiro de 2025 · OmniHuman 1.5: agosto de 2025 com emoções e gestos planejados por MLLM, clipes de até ~30 s.
- Melhor para: cabeças falantes UGC, explicadores sem rosto, diálogos de personagens, clipes musicais.
- No Rekreate: imagem + áudio + prompt, com detecção automática do sujeito falante.
Como funciona o OmniHuman
Ferramentas anteriores de cabeças falantes geralmente animavam apenas a região da boca de um rosto recortado. OmniHuman foi treinado com "omni-condições" — áudio, pose e sinais de texto misturados durante o treinamento — para que possa animar qualquer enquadramento: retratos em close, imagens de meio corpo e corpo inteiro, incluindo mãos, gestos e interações com objetos.
OmniHuman 1.5 introduziu um design de sistema duplo: um modelo de linguagem grande multimodal primeiro interpreta o significado e a emoção do áudio (e texto opcional), planeja reações e gestos apropriados, e então um transformador de difusão renderiza o movimento. O resultado é uma performance que reage ao conteúdo — ênfase em palavras-chave, pausas, sorrisos em uma punchline — e pode seguir instruções de texto para controle de câmera e gestos.
Versões do OmniHuman
OmniHuman-1
Artigo de pesquisa e demos mostrando vídeos humanos realistas a partir de uma imagem mais áudio, em enquadramentos de retrato, meio corpo e corpo inteiro, falando e cantando, incluindo desenhos animados e personagens estilizados.
OmniHuman 1.5
Adiciona planejamento semântico baseado em MLLM para emoções e gestos contextuais, orientação opcional por texto para câmera e gestos, cenas com múltiplas pessoas e vídeos mais longos e contínuos (até cerca de 30 segundos em APIs comuns).
As versões disponíveis variam por plataforma; a ByteDance oferece OmniHuman através do BytePlus/Volcano Engine e do ecossistema Dreamina/CapCut.
OmniHuman em resumo
| Desenvolvedor | ByteDance (Intelligent Creation / OmniHuman Lab) |
|---|---|
| Entradas | Imagem única, faixa de áudio, prompt de texto opcional |
| Enquadramentos | Retrato, meio corpo, corpo inteiro; personagens realistas e estilizados |
| Movimento | Sincronização labial, expressões faciais, gestos da cabeça e do corpo, alguma interação com objetos |
| Duração típica | Até ~30 s por geração (1.5, dependendo do provedor) |
| No Rekreate | Imagem + áudio + prompt; detecção automática do sujeito a ser animado |
OmniHuman vs outras abordagens de avatar
- vs avatares de estúdio (HeyGen, Synthesia): esses usam gêmeos digitais pré-treinados gravados em vídeo; OmniHuman anima qualquer imagem única, o que é mais rápido para novos personagens, mas menos controlável para roteiros muito longos.
- vs Seedance 2.x diálogo: Seedance gera cenas inteiras com áudio a partir de prompts e referências; OmniHuman é especializado em fazer uma imagem específica falar um áudio específico com sincronização labial precisa.
- vs Kling Motion Control: Motion Control copia movimentos de um vídeo de referência; OmniHuman inventa movimentos a partir de áudio.
Para UGC, uma combinação comum no Rekreate é: recriar um roteiro viral → gerar a voz com uma voz clonada → animar um retrato com OmniHuman → adicionar b-roll do Seedance ou Veo → legendar.
Dicas para melhores resultados com OmniHuman
- Use uma imagem nítida e de frente com a boca visível e expressão neutra.
- Combine o enquadramento ao conteúdo: imagens de meio corpo permitem gestos com as mãos; retratos fechados focam na expressão facial.
- Áudio limpo (sem música sob a fala) oferece a sincronização labial mais precisa.
- Mantenha as falas naturais — roteiros conversacionais com pausas animam melhor do que leituras rápidas e monótonas.
- Use o prompt para direção: "fala calorosamente, pequenos acenos, gestos ocasionais com as mãos, câmera estática."
- Obtenha consentimento antes de animar a imagem de uma pessoa real e rotule o conteúdo gerado por AI onde as plataformas exigirem.
Perguntas frequentes
O que é OmniHuman?
OmniHuman é o modelo de AI da ByteDance que gera um vídeo realista falante ou cantando a partir de uma única imagem e uma faixa de áudio, com sincronização labial, expressões faciais e gestos corporais.
Qual é a diferença entre OmniHuman-1 e OmniHuman 1.5?
OmniHuman 1.5 (agosto de 2025) adiciona um LLM multimodal que entende o significado e a emoção do áudio para planejar gestos e expressões, suporta orientação por texto para câmera e gestos, e produz vídeos mais longos e contínuos do que o OmniHuman-1 (fevereiro de 2025).
Qual é a duração máxima dos vídeos OmniHuman?
APIs comuns do OmniHuman 1.5 geram vídeos de até cerca de 30 segundos por execução; os limites dependem do provedor.
OmniHuman pode animar desenhos animados?
Sim. Funciona com personagens estilizados, desenhos animados e anime, além de retratos realistas.
OmniHuman está disponível no Rekreate?
Sim. O Rekreate usa OmniHuman para vídeos de avatares guiados por áudio: forneça uma imagem, uma faixa de áudio e um breve prompt.
Posso usar uma foto de celebridade com OmniHuman?
Não. Animar pessoas reais sem consentimento pode violar regras de plataformas e leis sobre imagem. Use sua própria imagem com permissão, avatares licenciados ou personagens originais gerados por AI.
Crie seu próximo vídeo viral com Rekreate
Encontre um vídeo curto comprovado, recrie-o com seu roteiro, avatar e voz, e gere cenas com Seedance, Kling e Veo em um único espaço de trabalho.
Iniciar teste gratuito →