OmniHuman은 ByteDance의 오디오 기반 인간 비디오 모델입니다. 사람 또는 캐릭터의 사진 한 장과 오디오 트랙을 입력하면, 립싱크, 표정, 머리 움직임, 몸짓이 자연스럽게 어우러진 영상을 생성합니다. 연구 모델 OmniHuman-1은 2025년 2월에 공개되었으며, OmniHuman 1.5는 2025년 8월에 발표되어 오디오의 의미를 이해하고 제스처와 감정을 맥락에 맞게 표현하는 기능이 추가되었습니다.
Rekreate에서는 OmniHuman을 활용해 오디오 기반 아바타 영상을 제작합니다: 초상화, 음성 트랙(예: 클론된 목소리) 및 간단한 지시문을 입력하세요.
- 입력: 사진 한 장(초상화, 상반신 또는 전신) + 오디오 + 선택적 텍스트 지시문.
- 출력: 립싱크된 말하거나 노래하는 영상과 자연스러운 제스처.
- OmniHuman-1: 2025년 2월 · OmniHuman 1.5: 2025년 8월, MLLM 기반 감정 및 제스처 계획 추가, 약 30초 길이의 클립 생성 가능.
- 적합한 용도: UGC 말하는 얼굴 영상, 얼굴 없는 설명 영상, 캐릭터 대화, 음악 클립.
- Rekreate에서: 사진 + 오디오 + 지시문, 말하는 인물을 자동으로 감지.
OmniHuman 작동 원리
기존의 말하는 얼굴 도구는 주로 얼굴 일부(입 주변)만 애니메이션화했습니다. OmniHuman은 "omni-conditions" — 오디오, 자세, 텍스트 신호를 혼합하여 훈련되었기 때문에 어떤 프레임 구성에서도 애니메이션이 가능합니다: 클로즈업 초상화, 상반신, 전신 이미지, 손 동작, 물체와의 상호작용까지 포함.
OmniHuman 1.5는 이중 시스템 설계를 도입했습니다: **멀티모달 대형 언어 모델(MLLM)**이 먼저 오디오(및 선택적 텍스트)의 의미와 감정을 해석하고 적절한 반응과 제스처를 계획한 후, 디퓨전 트랜스포머가 동작을 렌더링합니다. 결과적으로 콘텐츠에 반응하는 퍼포먼스를 제공합니다 — 키워드 강조, 멈춤, 유머 포인트에서의 미소 등 — 카메라와 제스처 제어를 위한 텍스트 지시문도 따를 수 있습니다.
OmniHuman 버전
OmniHuman-1
초상화, 상반신, 전신 프레임에서 사진 한 장과 오디오로 사실적인 인간 비디오를 생성하는 연구 논문 및 데모. 말하기와 노래하기, 만화 및 스타일화된 캐릭터 포함.
OmniHuman 1.5
MLLM 기반 의미 계획 추가로 맥락에 맞는 감정 및 제스처 표현, 카메라 및 제스처를 위한 선택적 텍스트 지시문 지원, 다인 장면 및 더 길고 연속적인 비디오 생성(일반 API 기준 약 30초까지).
사용 가능한 버전은 플랫폼에 따라 다릅니다. ByteDance는 BytePlus/Volcano Engine 및 Dreamina/CapCut 생태계를 통해 OmniHuman을 제공합니다.
OmniHuman 한눈에 보기
| 개발사 | ByteDance (Intelligent Creation / OmniHuman Lab) |
|---|---|
| 입력 | 사진 한 장, 오디오 트랙, 선택적 텍스트 지시문 |
| 프레임 구성 | 초상화, 상반신, 전신; 사실적 및 스타일화된 캐릭터 |
| 동작 | 립싱크, 표정, 머리 및 몸 동작, 일부 물체와의 상호작용 |
| 일반 길이 | 한 번 생성 시 약 30초까지 (1.5, 제공자 의존) |
| Rekreate에서 | 사진 + 오디오 + 지시문; 애니메이션화할 대상을 자동 감지 |
OmniHuman과 다른 아바타 접근법 비교
- vs 스튜디오 아바타 (HeyGen, Synthesia): 이들은 사전 녹화된 디지털 트윈을 사용하지만, OmniHuman은 어떤 사진 한 장도 애니메이션화할 수 있어 새로운 캐릭터 제작이 더 빠르지만 긴 스크립트에는 덜 적합합니다.
- vs Seedance 2.x 대화: Seedance는 프롬프트와 참조를 통해 전체 장면을 생성하지만, OmniHuman은 특정 사진을 특정 오디오 트랙에 맞춰 립싱크하는 데 특화되어 있습니다.
- vs Kling Motion Control: Motion Control은 참조 비디오에서 동작을 복사하지만, OmniHuman은 오디오에서 동작을 창작합니다.
Rekreate에서 일반적인 조합은 다음과 같습니다: 바이럴 스크립트를 다시 만들기 → 클론된 목소리로 음성 생성 → 초상화를 OmniHuman으로 애니메이션화 → Seedance 또는 Veo에서 B-roll 추가 → 캡션 삽입.
OmniHuman 결과를 개선하는 팁
- 선명하고 정면을 바라보는 사진을 사용하세요. 입이 보이고 표정이 중립적인 사진이 좋습니다.
- 콘텐츠에 맞는 프레임 구성: 상반신 사진은 손 동작을 허용하고, 클로즈업 초상화는 표정에 집중합니다.
- 깨끗한 오디오(음성 아래 음악 없음)가 가장 정확한 립싱크를 제공합니다.
- 자연스러운 대사를 사용하세요 — 대화체 스크립트와 멈춤이 있는 대사가 빠르고 단조로운 읽기보다 애니메이션화가 잘 됩니다.
- 지시문을 활용하세요: "따뜻하게 말하며, 작은 끄덕임, 가끔 손 동작, 고정된 카메라."
- 실제 인물의 초상을 애니메이션화하기 전에 동의를 얻고, 플랫폼에서 요구하는 경우 AI 생성 콘텐츠임을 표시하세요.
자주 묻는 질문
OmniHuman이란?
OmniHuman은 ByteDance의 AI 모델로, 사진 한 장과 오디오 트랙을 기반으로 립싱크, 표정 및 몸 동작이 포함된 사실적인 말하거나 노래하는 영상을 생성합니다.
OmniHuman-1과 OmniHuman 1.5의 차이점은 무엇인가요?
OmniHuman 1.5(2025년 8월)는 오디오의 의미와 감정을 이해하는 멀티모달 LLM을 추가하여 제스처와 표정을 계획하고, 카메라와 제스처를 위한 텍스트 지시문을 지원하며, OmniHuman-1(2025년 2월)보다 더 길고 연속적인 영상을 생성할 수 있습니다.
OmniHuman 영상은 얼마나 길게 생성할 수 있나요?
일반적인 OmniHuman 1.5 API는 한 번에 약 30초 길이의 영상을 생성할 수 있습니다. 제한은 제공자에 따라 다릅니다.
OmniHuman이 만화 캐릭터도 애니메이션화할 수 있나요?
네. 사실적인 초상화뿐만 아니라 스타일화된 만화 및 애니메이션 캐릭터에도 사용할 수 있습니다.
OmniHuman이 Rekreate에서 사용 가능한가요?
네. Rekreate는 OmniHuman을 사용하여 오디오 기반 아바타 영상을 제작합니다: 사진, 오디오 트랙 및 간단한 지시문을 제공하세요.
유명인 사진을 OmniHuman으로 사용할 수 있나요?
아니요. 실제 인물을 동의 없이 애니메이션화하는 것은 플랫폼 규칙 및 초상권 관련 법률을 위반할 수 있습니다. 본인의 사진, 허가받은 아바타 또는 독창적인 AI 캐릭터를 사용하세요.
Rekreate로 다음 바이럴 비디오를 제작하세요
검증된 단편 비디오를 찾아, 스크립트, 아바타, 음성을 사용해 다시 만들고, Seedance, Kling, Veo로 장면을 생성하세요.
무료 체험 시작 →