Rekreate
Руководство по моделям

OmniHuman: одно фото + аудио = говорящее видео

Как работает модель анимации человека от ByteDance, что улучшила OmniHuman 1.5 и как её использовать для UGC-аватаров.

Обновлено Автор Rekreate Editorial Team, ИИ-видео исследования
Содержание Как работает OmniHumanВерсии OmniHumanOmniHuman в двух словахOmniHuman vs другие подходы к аватарамСоветы для лучших результатов с OmniHumanЧасто задаваемые вопросы

OmniHuman — это модель видео с человеком, управляемая аудио, от ByteDance. Загрузите одно изображение человека или персонажа и аудиотрек, и она создаст видео, где объект говорит или поёт с синхронизацией губ, выражениями лица, движениями головы и жестами тела. Исследовательская модель OmniHuman-1 была представлена в феврале 2025 года, а OmniHuman 1.5, выпущенная в августе 2025 года, добавила семантическое понимание аудио, чтобы жесты и эмоции соответствовали содержанию, а не только ритму.

В Rekreate OmniHuman используется для создания видео-аватаров, управляемых аудио: вы загружаете портрет, голосовой трек (например, сгенерированный голос) и короткий промпт.

Основные выводы
  • Входные данные: одно изображение (портрет, полукорпус или полный корпус) + аудио + текстовая подсказка (опционально).
  • Результат: говорящее или поющее видео с синхронизацией губ и естественными жестами.
  • OmniHuman-1: февраль 2025 · OmniHuman 1.5: август 2025 с эмоциями и жестами, запланированными MLLM, клипы до ~30 секунд.
  • Лучше всего подходит для: UGC-видео с говорящими головами, объясняющих роликов без лица, диалогов персонажей, музыкальных клипов.
  • В Rekreate: изображение + аудио + промпт с автоматическим определением объекта для анимации.

Как работает OmniHuman

Ранние инструменты для говорящих голов в основном анимировали область рта на обрезанном изображении лица. OmniHuman обучалась на «омни-условиях» — аудио, позах и текстовых сигналах, смешанных во время обучения, — поэтому она может анимировать любой кадр: крупные портреты, полукорпусные и полнотелые изображения, включая руки, жесты и взаимодействие с объектами.

OmniHuman 1.5 представила двухсистемный дизайн: мультимодальная большая языковая модель сначала интерпретирует смысл и эмоцию аудио (и опционального текста), планирует подходящие реакции и жесты, а затем диффузионный трансформер визуализирует движение. Результат — это исполнение, которое реагирует на содержание: акценты на ключевых словах, паузы, улыбки на кульминации — и может следовать текстовым инструкциям для управления камерой и жестами.

Версии OmniHuman

Февраль 2025

OmniHuman-1

Исследовательская статья и демонстрации, показывающие реалистичное видео с человеком из одного изображения и аудио, включая портреты, полукорпусные и полнотелые кадры, говорящих и поющих персонажей, а также мультяшных и стилизованных героев.

Август 2025

OmniHuman 1.5

Добавляет семантическое планирование на основе MLLM для эмоций и жестов, учитывающих контекст, текстовые подсказки для управления камерой и жестами, сцены с несколькими персонажами и более длинные, непрерывные видео (до ~30 секунд на популярных API).

Доступные версии зависят от платформы; ByteDance предлагает OmniHuman через BytePlus/Volcano Engine и экосистему Dreamina/CapCut.

OmniHuman в двух словах

Разработчик ByteDance (Intelligent Creation / OmniHuman Lab)
Входные данные Одно изображение, аудиотрек, текстовая подсказка (опционально)
Кадры Портрет, полукорпус, полный корпус; реалистичные и стилизованные персонажи
Движение Синхронизация губ, выражения лица, движения головы и тела, взаимодействие с объектами
Типичная длина До ~30 секунд за генерацию (1.5, зависит от провайдера)
В Rekreate Изображение + аудио + промпт; автоматическое определение объекта для анимации

OmniHuman vs другие подходы к аватарам

  • vs студийные аватары (HeyGen, Synthesia): те используют заранее записанные цифровые двойники; OmniHuman анимирует любое одно изображение, что быстрее для новых персонажей, но менее управляемо для длинных сценариев.
  • vs Seedance 2.x диалоги: Seedance генерирует целые сцены с аудио из промптов и референсов; OmniHuman специализируется на том, чтобы заставить конкретное изображение говорить конкретный аудиотрек с точной синхронизацией губ.
  • vs Kling Motion Control: Motion Control копирует движения из референсного видео; OmniHuman придумывает движения из аудио.

Для UGC в Rekreate часто используют комбинацию: переснять вирусный сценарий → сгенерировать голос с клонированным голосом → анимировать портрет с OmniHuman → добавить b-roll из Seedance или Veo → наложить субтитры.

Советы для лучших результатов с OmniHuman

  1. Используйте чёткое, фронтальное изображение с видимым ртом и нейтральным выражением.
  2. Подбирайте кадр под контент: полукорпусные изображения позволяют использовать жесты руками; крупные портреты акцентируют внимание на выражении лица.
  3. Чистое аудио (без музыки под речь) обеспечивает наиболее точную синхронизацию губ.
  4. Скрипт должен быть естественным — разговорные тексты с паузами анимируются лучше, чем монотонное чтение.
  5. Используйте промпт для направления: «говорит тепло, небольшие кивки, редкие жесты руками, статичная камера.»
  6. Получите согласие перед анимацией изображения реального человека и маркируйте контент, созданный ИИ, если это требуется платформами.

Часто задаваемые вопросы

Что такое OmniHuman?

OmniHuman — это ИИ-модель от ByteDance, которая создаёт реалистичное говорящее или поющее видео из одного изображения и аудиотрека с синхронизацией губ, выражениями лица и жестами тела.

Чем отличаются OmniHuman-1 и OmniHuman 1.5?

OmniHuman 1.5 (август 2025) добавляет мультимодальную LLM, которая понимает смысл и эмоцию аудио, чтобы планировать жесты и выражения, поддерживает текстовые подсказки для управления камерой и жестами, а также создаёт более длинные и непрерывные видео по сравнению с OmniHuman-1 (февраль 2025).

Какой длины могут быть видео OmniHuman?

Обычно API OmniHuman 1.5 генерируют видео до ~30 секунд за один запуск; ограничения зависят от провайдера.

Может ли OmniHuman анимировать мультяшных персонажей?

Да. Она работает со стилизованными, мультяшными и аниме-персонажами, а также с реалистичными портретами.

Доступен ли OmniHuman в Rekreate?

Да. В Rekreate используется OmniHuman для видео-аватаров, управляемых аудио: загрузите изображение, аудиотрек и короткий промпт.

Можно ли использовать фото знаменитости с OmniHuman?

Нет. Анимация реальных людей без согласия может нарушать правила платформ и законы о защите изображения. Используйте своё изображение с разрешения, лицензированные аватары или оригинальных персонажей, созданных ИИ.

Создайте своё следующее вирусное видео с Rekreate

Найдите проверенное короткое видео, переснимите его со своим сценарием, аватаром и голосом, создайте сцены с Seedance, Kling и Veo в одном рабочем пространстве.

Начать бесплатный пробный период →

Связанные руководства

Источники

  1. OmniHuman 1.5 audio-driven digital human, Hedra
  2. OmniHuman 1.5 image and audio to video, RunComfy
  3. OmniHuman 1.5 explained, Vidmuse