Разбираем модель липсинка MiniMax H3 avatars. Учимся оживлять фотографии с помощью готовой звуковой дорожки, настраивать артикуляцию и работать с 2K-разрешением.
У вас есть фотография героя и готовая звуковая дорожка — реплика, обращение или припев песни. Хочется, чтобы человек на снимке действительно это произнёс, а не просто моргал под музыку.
За такие задачи в каталоге отвечает раздел липсинка, и MiniMax H3 avatars — единственная модель в нём, которая выдаёт 2K.
Обычная MiniMax H3 сама придумывает звук по вашему описанию. Версия avatars звук не придумывает: она берёт вашу дорожку и подгоняет под неё артикуляцию, мимику и движения головы героя с фотографии.
Отсюда два практических следствия. Голос будет ровно тот, который вы загрузили, без сюрпризов с тембром и акцентом. А длительность ролика придётся подгонять под длительность аудио, а не наоборот.
Промпт при этом никуда не девается — он описывает сцену, свет и движение камеры. За речь отвечает файл, за всё остальное текст.
Стартового и конечного кадра у модели нет, фотография загружается в референсы.
Мы взяли фирменный трек VeoSuno с женским вокалом и вырезали из него припев.
Здесь есть подвох, о который легко споткнуться. Слайдер длительности работает целыми секундами, а припев после обрезки длился 9,46 секунды. Поставить 9 — обрежется последняя нота, поставить 10 — в хвосте появится полсекунды тишины. Мы выбрали второе и заранее привели файл ровно к десяти секундам, добавив короткое затухание в конце: иначе на стыке звука и тишины слышен щелчок.
Исходная звуковая дорожка:
Фотографию взяли вертикальную, 2:3 — диджей за пультом на фоне неоновой вывески.
Промпт описывал не речь, а сцену вокруг неё:
A blonde DJ with tattooed arms stands behind her mixer and sings the chorus straight into the room, chin lifting slightly on the long notes. Her head and shoulders move with the beat, her right hand rests on the mixer, her left hand rides a fader. Behind her the neon VeoSuno sign glows and thin laser lines drift across the wall, haze moving slowly through the light. The camera pushes in a few centimetres, very slowly, and settles. Shot on a 50mm lens, shallow depth of field, natural film grain, soft bloom around the neon, warm practical light on her face, real skin texture with visible pores and stray hairs, her braided strands swaying slightly. Cinematic music video look, not a 3D render, not a video game.
Настройки: 10 секунд, 2K, соотношение 16:9. Обратите внимание — исходное фото вертикальное, а формат ролика мы задали горизонтальный.
Модель достроила кадр, а не обрезала его. По бокам появились стены с лазерами, вторая пара колонок, продолжение подиума. Героиня, вывеска и пульт при этом остались ровно такими же, как на исходном снимке.
Артикуляция идёт под пение, а не под речь. Рот открывается по вокальной линии, на длинных нотах подбородок уходит вверх. Это не самый очевидный сценарий: многие модели липсинка уверенно держат только разговор.
Камера послушалась промпта. Медленный наезд отработал, к финалу лицо в кадре заметно крупнее. Побочный эффект — верх неоновой вывески к концу подрезается краем кадра. Если логотип должен оставаться целым все десять секунд, наезд из промпта лучше убрать.
Цена считается за секунду готового ролика и зависит только от разрешения: от 12 ₽ за секунду в 768P и 19 ₽ в 2K. Зависимость линейная, скидок за длину нет.
Наши десять секунд в 2K обошлись в 190 ₽. Те же десять секунд в 768P стоили бы 120 ₽, а минимальные четыре — 48 ₽.
Отсюда рабочий порядок: короткий тест на четырёх секундах в 768P, проверка артикуляции, и только потом полная длительность в 2K.
Модель доступна в каталоге — открывайте MiniMax H3 avatars и загружайте фотографию с дорожкой.
Дорожку необязательно записывать самому: трек можно собрать с нуля, сделать кавером готовой песни или вырастить из собственной демозаписи.
Совет: Чем крупнее лицо в исходном кадре, тем чище артикуляция. На общем плане, где голова занимает малую часть кадра, рот прорисовывается заметно хуже — модели просто не хватает пикселей. Обрежьте снимок до среднего плана перед загрузкой.
Остальные модели раздела мы разбираем на том же фото и той же дорожке, так что результаты сравнимы напрямую: InfiniteTalk AI вдвое дешевле и сохраняет исходный кадр как есть, Kling AI Avatar 2.0 даёт 1080p и ролики до пяти минут, OmniHuman 1.5 делает упор на мимику и жесты.
Если вы ещё не генерировали видео, начните с пошагового гайда для новичка.
MiniMax H3 avatars — модель для создания говорящего аватара: из фотографии и загруженной звуковой дорожки она собирает видео, где человек произносит или поёт то, что записано. Голос берётся из вашего файла, модель отвечает за артикуляцию, мимику и движения головы.
Обычная H3 придумывает звук сама по текстовому описанию. Версия avatars звук не придумывает: она берёт вашу дорожку и подгоняет под неё героя с фотографии. Промпт при этом описывает сцену, свет и движение камеры, а за речь отвечает файл.
12 ₽ за секунду в 768P и 19 ₽ в 2K. Десятисекундный ролик обойдётся в 120 ₽ или 190 ₽ соответственно, минимальные четыре секунды в 768P — в 48 ₽.
От 4 до 15 секунд с шагом в одну секунду. Длительность задаётся ползунком, поэтому звуковую дорожку стоит заранее подрезать под целое число секунд.
768P и 2K. Это единственная модель раздела липсинка, которая выдаёт 2K — на выходе получается файл 2560×1440 при 24 кадрах в секунду.
Да. Соотношение сторон выбирается отдельно от пропорций снимка: доступны 21:9, 16:9, 9:16, 1:1, 2:3, 3:2, 4:3 и 5:4. Недостающую часть сцены модель достраивает сама, сохраняя героя и обстановку.
Дорожка сохраняется в стерео и не сводится в моно. Для клипа это важно: панорама трека остаётся такой, какой вы её загрузили.