Открытая 15B · Apache 2.0

От портрета к lip-sync говорящему видеоза один бесплатный проход ИИ

Одно фото плюс текст или аудио — естественное говорящее видео с lip-sync. daVinci-MagiHuman генерирует аудио и видео вместе.

Browse all examples
  • 15BПараметры
  • Apache 2.0Лицензия
  • ~2сВремя*

Live demo

Portrait → lip-synced talking video

Demo
Demo sample 1
Demo sample 2
Demo sample 4
Demo sample 6

Official open-source demos from GAIR Lab & Sand.ai

Browse all examples

Продолжение в студии

*Ориентир на GPU класса H100 при 256p; фактическая скорость зависит от настроек и железа.

Examples

See daVinci-MagiHuman in action

Official demo clips from the open research release — expressive faces, natural speech, and audio–video generated together.

Collage of daVinci-MagiHuman talking video demos
Multi-scene showcase from the official model release

Sample 1

Demo

Sample 2

Demo

Sample 3

Demo

Sample 4

Demo

Sample 5

Demo

Sample 6

Demo

Sample 7

Demo

Clips adapted from the official GAIR-NLP / Sand.ai daVinci-MagiHuman demos (web-optimized, muted autoplay).

Обзор

Что такое daVinci-MagiHuman?

daVinci-MagiHuman single-stream Transformer architecture diagram
Single-stream Transformer jointly denoises video and audio tokens with a reference image latent

Открытая модель и исследовательские партнёры

daVinci-MagiHuman — открытая ИИ‑модель на 15B параметров от Sand.ai и GAIR Lab (Шанхайский университет Цзяотун), под лицензией Apache 2.0: можно изучать веса, запускать локально и использовать в коммерции в рамках лицензии.

Единая генерация аудио и видео

daVinci-MagiHuman принимает портрет плюс текст или аудио и выдаёт говорящее видео с согласованным звуком. Однопоточный Transformer daVinci-MagiHuman убирает шум с видео и аудио вместе, а не в раздельных конвейерах.

Скорость, качество и бенчмарки

На NVIDIA H100 daVinci-MagiHuman может сгенерировать короткий клип 256p за ~2 с на ~2 с контента (зависит от настроек и железа). В оценках daVinci-MagiHuman показывает низкий WER и сильное человеческое предпочтение относительно ряда базовых моделей.

Возможности

Ключевые возможности

Шесть причин оценить daVinci-MagiHuman для аудио‑видео аватаров — те же преимущества daVinci-MagiHuman, нашли ли вы модель по запросу davinci-magihuman или через статьи.

Единое аудио + видео

daVinci-MagiHuman генерирует обе модальности за один проход — без отдельного TTS и склейки видео.

Опорное фото

daVinci-MagiHuman использует один портрет как визуальный якорь говорящей головы.

Многоязычность

daVinci-MagiHuman поддерживает несколько языков для синхронизации губ (зависит от обучающих данных и релизов).

Открытый код

Apache 2.0 — веса daVinci-MagiHuman можно использовать и расширять коммерчески в рамках лицензии.

Быстрый инференс

daVinci-MagiHuman: ~2 с для ~2 с при 256p на GPU класса H100 (ориентировочно).

Качество уровня SOTA

В публикациях daVinci-MagiHuman показывает сильные WER и предпочтение перед Ovi 1.1 и LTX 2.3.

Сравнение

Сравнение daVinci-MagiHuman

Ориентировочная сводка; цифры зависят от бенчмарков и промптов. У daVinci-MagiHuman сообщается WER ~14,6% против ~40,5% у Ovi 1.1 и большое преимущество в человеческих сравнениях с Ovi и LTX 2.3.

WER и разборчивость речи

Ниже WER обычно означает более чёткую речь для daVinci-MagiHuman. Таблица сравнивает диапазоны на похожих протоколах, где daVinci-MagiHuman — открытая база.

Человеческое предпочтение

Попарные оценки показывают предпочтительные по естественности и согласованности результаты — в том числе когда daVinci-MagiHuman обходит закрытые модели.

Лицензия и задержка

Открытые веса Apache 2.0 позволяют хостить daVinci-MagiHuman самостоятельно; проприетарные стеки закрыты; время зависит от GPU и разрешения для каждой задачи daVinci-MagiHuman.

МодельWER (↓)Человеческое предпочтениеЛицензияСкорость (ориентир)
daVinci-MagiHuman Выбор~14,6 %~80 % против Ovi 1.1; сильно против LTX 2.3Apache 2.0~2 с для ~2 с при 256p на 1× H100 (указано)
Ovi 1.1~40,5 %Ниже daVinci в опубликованных сравненияхПроприетарнаяЗависит от API / развёртывания
LTX 2.3Выше WER в той же таблице (варьируется)Уступает daVinci в человеческих оценкахПроприетарнаяЗависит от разрешения и стека

Процесс

Как использовать daVinci-MagiHuman

Reference portrait photo1

Input

Upload a clear portrait

2

“Turn one portrait into a lip-synced talking video…”

Drive

Add script or audio

3

Output

Get a lip-synced clip

1

Подготовить портрет и сценарий

  1. Загрузить портрет — желательно чёткое лицо анфас.
  2. Ввести сценарий или загрузить аудиофайл — модель синхронизирует губы с речью.
2

Выбрать разрешение и запустить генерацию

  1. Выбрать выходное разрешение — напр. 256p, 720p или 1080p в зависимости от стека инференса и VRAM.
  2. Скачать говорящее видео после завершения задачи.
3

Самохостинг и Hugging Face Hub

Для локального или серверного запуска скачайте чекпоинты daVinci-MagiHuman с Hub и следуйте README для CLI и окружения. URL davinci-magihuman и репозиторий daVinci-MagiHuman обновляются с релизами.

Пример (Python / Hugging Face)

# Load model weights from Hugging Face Hub (see official repo for exact APIs)
from huggingface_hub import snapshot_download

repo_id = "GAIR/daVinci-MagiHuman"
local_dir = snapshot_download(repo_id)
# Follow GAIR-NLP/daVinci-MagiHuman README for inference scripts and CLI flags.

FAQ

Частые вопросы

Двенадцать частых вопросов о daVinci-MagiHuman. Раскройте пункт, чтобы прочитать ответ.

Что такое daVinci-MagiHuman?

daVinci-MagiHuman — аудио‑видео модель на 15B от Sand.ai и GAIR Lab (SJTU), превращающая портрет плюс текст или аудио в говорящий клип с синхронизацией губ.

daVinci-MagiHuman бесплатен?

Открытые веса и код daVinci-MagiHuman под Apache 2.0. У хостинговых демо могут быть другие условия; самохостинг daVinci-MagiHuman следует лицензии.

Какие нужны входы?

Обычно daVinci-MagiHuman требует изображение лица и текстовый или аудио драйвер; форматы и лимиты — в README инференса.

Сравнение с Sora или Veo?

Это общие видеосистемы. daVinci-MagiHuman ориентирован на говорящую голову аудио‑видео с открытыми весами.

Коммерческое использование?

Apache 2.0 допускает коммерческое использование daVinci-MagiHuman на условиях лицензии. Проверьте обязанности при распространении контента, сгенерированного daVinci-MagiHuman.

Где скачать или попробовать daVinci-MagiHuman?

Используйте карточку модели и связанный Hugging Face Space на этой странице или клонируйте GitHub для скриптов и чекпоинтов daVinci-MagiHuman.

Какие языки для синхронизации губ?

Охват daVinci-MagiHuman зависит от модели и данных; список языков — в README.

Какой GPU или железо?

Пропускная способность daVinci-MagiHuman зависит от класса GPU и разрешения; в отчётах для коротких клипов указывают H100; слабее GPU — ниже разрешение или дистилляция.

Как лучше портрет?

Для daVinci-MagiHuman: чёткое фото анфас, ровный свет, нейтральное или выразительное лицо. Избегайте сильного перекрытия, экстремальных ракурсов и низкого разрешения.

Чистое аудио вместо текста?

Да, если путь инференса daVinci-MagiHuman поддерживает аудио‑кондиционирование; форматы и длительности — в документации.

Лицензия на сгенерированный контент?

Веса daVinci-MagiHuman — Apache 2.0; сгенерированный контент регулируется вашим использованием, правами на входы и применимым правом.

Куда сообщать об ошибках и просить функции?

Issues в репозитории GitHub GAIR-NLP/daVinci-MagiHuman с логами, железом и шагами воспроизведения.

Создавайте говорящие видео с ИИ

Попробуйте публичный Space, скачайте веса daVinci-MagiHuman на Hugging Face или клонируйте открытый daVinci-MagiHuman на GitHub. Все пути следуют одному потоку davinci-magihuman / daVinci-MagiHuman.

Space в браузере

Хостинговая демо daVinci-MagiHuman для быстрого теста без установки.

Веса на Hugging Face

Скачайте чекпоинты daVinci-MagiHuman и смотрите карточку модели для форматов, вариантов и лицензии.

Исходники на GitHub

Клонируйте скрипты инференса daVinci-MagiHuman, открывайте issues и следите за релизами.