Пополни на 250 ₽

Пополни баланс на 250 рублей и получи 30 руб. бонусом

Пополнить

Пример промпта для изображения

Блог
Говорящий аватар из фото и аудио: MiniMax H3 avatars

Говорящий аватар из фото и аудио: MiniMax H3 avatars

Разбираем модель липсинка MiniMax H3 avatars. Учимся оживлять фотографии с помощью готовой звуковой дорожки, настраивать артикуляцию и работать с 2K-разрешением.

мин
veosuno

У вас есть фотография героя и готовая звуковая дорожка — реплика, обращение или припев песни. Хочется, чтобы человек на снимке действительно это произнёс, а не просто моргал под музыку.

За такие задачи в каталоге отвечает раздел липсинка, и MiniMax H3 avatars — единственная модель в нём, которая выдаёт 2K.

Что умеет модель MiniMax H3 avatars

  • Ролики длительностью от 4 до 15 секунд, шаг в одну секунду
  • Разрешение 768P и 2K, на выходе 2560×1440 при 24 кадрах в секунду
  • Восемь соотношений сторон: 21:9, 16:9, 9:16, 1:1, 2:3, 3:2, 4:3 и 5:4
  • Стереозвук: исходная дорожка не схлопывается в моно
  • До девяти изображений-референсов, аудио в MP3, WAV или OGG, при желании исходное видео
  • Цена от 12 ₽ за секунду

Чем MiniMax H3 avatars отличается от обычной MiniMax H3

Обычная MiniMax H3 сама придумывает звук по вашему описанию. Версия avatars звук не придумывает: она берёт вашу дорожку и подгоняет под неё артикуляцию, мимику и движения головы героя с фотографии.

Отсюда два практических следствия. Голос будет ровно тот, который вы загрузили, без сюрпризов с тембром и акцентом. А длительность ролика придётся подгонять под длительность аудио, а не наоборот.

Промпт при этом никуда не девается — он описывает сцену, свет и движение камеры. За речь отвечает файл, за всё остальное текст.

Стартового и конечного кадра у модели нет, фотография загружается в референсы.

Пример работы MiniMax H3 avatars: диджей поёт припев

Мы взяли фирменный трек VeoSuno с женским вокалом и вырезали из него припев.

Здесь есть подвох, о который легко споткнуться. Слайдер длительности работает целыми секундами, а припев после обрезки длился 9,46 секунды. Поставить 9 — обрежется последняя нота, поставить 10 — в хвосте появится полсекунды тишины. Мы выбрали второе и заранее привели файл ровно к десяти секундам, добавив короткое затухание в конце: иначе на стыке звука и тишины слышен щелчок.

Исходная звуковая дорожка:

Фотографию взяли вертикальную, 2:3 — диджей за пультом на фоне неоновой вывески.

Вертикальная фотография диджея для создания аватара

Промпт описывал не речь, а сцену вокруг неё:

A blonde DJ with tattooed arms stands behind her mixer and sings the chorus straight into the room, chin lifting slightly on the long notes. Her head and shoulders move with the beat, her right hand rests on the mixer, her left hand rides a fader. Behind her the neon VeoSuno sign glows and thin laser lines drift across the wall, haze moving slowly through the light. The camera pushes in a few centimetres, very slowly, and settles. Shot on a 50mm lens, shallow depth of field, natural film grain, soft bloom around the neon, warm practical light on her face, real skin texture with visible pores and stray hairs, her braided strands swaying slightly. Cinematic music video look, not a 3D render, not a video game.

Настройки: 10 секунд, 2K, соотношение 16:9. Обратите внимание — исходное фото вертикальное, а формат ролика мы задали горизонтальный.

Что получилось после генерации в MiniMax H3 avatars

Модель достроила кадр, а не обрезала его. По бокам появились стены с лазерами, вторая пара колонок, продолжение подиума. Героиня, вывеска и пульт при этом остались ровно такими же, как на исходном снимке.

Артикуляция идёт под пение, а не под речь. Рот открывается по вокальной линии, на длинных нотах подбородок уходит вверх. Это не самый очевидный сценарий: многие модели липсинка уверенно держат только разговор.

Камера послушалась промпта. Медленный наезд отработал, к финалу лицо в кадре заметно крупнее. Побочный эффект — верх неоновой вывески к концу подрезается краем кадра. Если логотип должен оставаться целым все десять секунд, наезд из промпта лучше убрать.

Сколько стоит генерация видео

Цена считается за секунду готового ролика и зависит только от разрешения: от 12 ₽ за секунду в 768P и 19 ₽ в 2K. Зависимость линейная, скидок за длину нет.

Наши десять секунд в 2K обошлись в 190 ₽. Те же десять секунд в 768P стоили бы 120 ₽, а минимальные четыре — 48 ₽.

Отсюда рабочий порядок: короткий тест на четырёх секундах в 768P, проверка артикуляции, и только потом полная длительность в 2K.

Как попробовать модель MiniMax H3 avatars

Модель доступна в каталоге — открывайте MiniMax H3 avatars и загружайте фотографию с дорожкой.

Дорожку необязательно записывать самому: трек можно собрать с нуля, сделать кавером готовой песни или вырастить из собственной демозаписи.

Совет: Чем крупнее лицо в исходном кадре, тем чище артикуляция. На общем плане, где голова занимает малую часть кадра, рот прорисовывается заметно хуже — модели просто не хватает пикселей. Обрежьте снимок до среднего плана перед загрузкой.

Остальные модели раздела мы разбираем на том же фото и той же дорожке, так что результаты сравнимы напрямую: InfiniteTalk AI вдвое дешевле и сохраняет исходный кадр как есть, Kling AI Avatar 2.0 даёт 1080p и ролики до пяти минут, OmniHuman 1.5 делает упор на мимику и жесты.

Если вы ещё не генерировали видео, начните с пошагового гайда для новичка.

FAQ: частые вопросы о MiniMax H3 avatars

Что такое MiniMax H3 avatars

MiniMax H3 avatars — модель для создания говорящего аватара: из фотографии и загруженной звуковой дорожки она собирает видео, где человек произносит или поёт то, что записано. Голос берётся из вашего файла, модель отвечает за артикуляцию, мимику и движения головы.

Чем версия avatars отличается от обычной MiniMax H3

Обычная H3 придумывает звук сама по текстовому описанию. Версия avatars звук не придумывает: она берёт вашу дорожку и подгоняет под неё героя с фотографии. Промпт при этом описывает сцену, свет и движение камеры, а за речь отвечает файл.

Сколько стоит ролик в MiniMax H3 avatars

12 ₽ за секунду в 768P и 19 ₽ в 2K. Десятисекундный ролик обойдётся в 120 ₽ или 190 ₽ соответственно, минимальные четыре секунды в 768P — в 48 ₽.

Какая максимальная длина ролика

От 4 до 15 секунд с шагом в одну секунду. Длительность задаётся ползунком, поэтому звуковую дорожку стоит заранее подрезать под целое число секунд.

В каком разрешении работает модель

768P и 2K. Это единственная модель раздела липсинка, которая выдаёт 2K — на выходе получается файл 2560×1440 при 24 кадрах в секунду.

Можно ли сделать горизонтальный ролик из вертикального фото

Да. Соотношение сторон выбирается отдельно от пропорций снимка: доступны 21:9, 16:9, 9:16, 1:1, 2:3, 3:2, 4:3 и 5:4. Недостающую часть сцены модель достраивает сама, сохраняя героя и обстановку.

Что происходит со звуком на выходе

Дорожка сохраняется в стерео и не сводится в моно. Для клипа это важно: панорама трека остаётся такой, какой вы её загрузили.