Проверили в деле OmniHuman 1.5 — модель, которая оживляет фотографии под любую звуковую дорожку. Показываем результаты, разбираем лимиты и нюансы работы со звуком.
Анимация фото под голос — это когда из одного снимка и звуковой дорожки получается видео, где человек говорит или поёт. OmniHuman 1.5 в VeoSuno делает именно это, и её главное обещание — не просто попадание губ в звук, а мимика и жесты, считанные из самой записи.
Разработчик модели, компания ByteDance, описывает это так: система разбирает ритм, интонацию и смысл того, что звучит, и подбирает выражение лица под интонацию — даже если в описании сцены об эмоциях ничего не сказано.
Мы проверили на живом примере.
Заявленные разработчиком возможности, которые мы в этом тесте не проверяли: ролики длиннее минуты, несколько говорящих персонажей в кадре с раздельными дорожками, а также анимация животных и мультяшных героев.
Поле промпта у этой модели вмещает 300 символов — счётчик под полем показывает, сколько осталось.
Это самый жёсткий лимит среди моделей раздела, и он влияет на работу сильнее, чем кажется. Триста символов — это два-три предложения. В них помещается кто в кадре, что делает и что вокруг. Не помещается ничего из операторского языка: объектив, характер света, зерно, движение камеры.
Практический вывод: описывайте героя и обстановку, а не съёмку. Всё, что касается картинки, модель решит сама на основе загруженного снимка.
Мы взяли фирменный трек VeoSuno с женским вокалом, вырезали припев и привели файл ровно к десяти секундам.
Вырезанный припев для анимации:
Фотография — вертикальный кадр, диджей за пультом на фоне неоновой вывески.
Из-за лимита в 300 символов промпт пришлось сократить до трёх предложений:
Blonde DJ with tattooed arms stands behind her mixer and sings the chorus straight into the room, chin lifting slightly on the long notes. Her head and shoulders move with the beat, her right hand rests on the mixer. Behind her the neon VeoSuno sign glows and thin laser lines drift across the wall
Разрешение выбрали 720p. Ролик обошёлся в 400 ₽.
Лицо сохранилось. Героиня узнаётся на всём протяжении ролика: овал, скулы, форма губ остаются близки к исходному снимку. Для моделей липсинка это не данность — многие к концу генерации уводят черты в сторону.
Мимика сдержанная и по делу. Модель не стала добавлять широкую улыбку и не зажмурила глаза. Выражение меняется вместе с вокальной линией: на длинных нотах подбородок идёт вверх, между фразами лицо успокаивается.
Появились жесты. На шестой секунде героиня снимает левую руку с пульта и поднимает её к груди, сжав кулак, — характерный жест под музыку. В промпте этого нет, модель добавила движение сама, и оно выглядит уместно.
Фон переосмыслен. А вот тут модель ушла далеко от оригинала: редкие оранжевые лазерные линии превратились в плотный веер розово-пурпурных лучей, и рисунок меняется по ходу ролика. Неоновая вывеска к финалу тоже меняет оттенок. Герой сохранён, обстановка вокруг него — переписана.
Звук сводится в моно. Мы загружали стереодорожку 44,1 кГц, на выходе получили моно с той же частотой. Частота сохранилась, панорама — нет. Если делаете клип, звук лучше подложить отдельно при монтаже.
Движение камеры мы не проверили. Инструкция про медленный наезд не поместилась в 300 символов, поэтому судить о том, слушается ли модель в этой части, по нашему тесту нельзя. Разработчик управление камерой через промпт заявляет.
Цена у OmniHuman 1.5 считается за секунду готового ролика и не зависит от разрешения:
| Разрешение | За секунду | Ролик на 10 секунд | Ролик на минуту |
|---|---|---|---|
| 720p | 40 ₽ | 400 ₽ | 2400 ₽ |
| 1080p | 40 ₽ | 400 ₽ | 2400 ₽ |
Это редкий случай в каталоге: обычно каждая ступень качества добавляет к счёту. Здесь 720p и 1080p стоят одинаково, а значит выбирать 720p имеет смысл только ради веса файла.
Длительность вы задаёте не ползунком, а длиной аудиодорожки. Поэтому обрезать звук нужно заранее — например, прямо в карточке трека, без сторонних редакторов.
Модель стоит брать, когда важно сохранить лицо конкретного человека и получить живую подачу без ручной анимации: говорящий аватар для соцсетей, обращение от лица бренда, поющий персонаж в клипе, оживший портрет.
Не стоит рассчитывать на неё, если нужен контроль над картинкой: операторские инструкции в 300 символов не помещаются, а обстановку вокруг героя модель может переписать по-своему.
Модель доступна в каталоге — открывайте OmniHuman 1.5 и загружайте фотографию с дорожкой.
Дорожку необязательно записывать самому: трек можно собрать с нуля, сделать кавером готовой песни или вырастить из собственной демозаписи.
Совет: берите фотографию, где лицо занимает заметную часть кадра. Чем крупнее лицо в исходнике, тем чище артикуляция — модели просто хватает пикселей на прорисовку рта.
Остальные модели раздела мы прогнали на том же фото и той же дорожке, так что результаты можно сравнить самому: MiniMax H3 avatars, InfiniteTalk AI, Kling AI Avatar 2.0. Если раньше не работали с генерацией видео, начните с пошагового гайда для новичка.
OmniHuman 1.5 — модель для анимации фото под голос: из одного изображения и звуковой дорожки она собирает видео, где человек говорит или поёт. Помимо синхронизации губ модель добавляет мимику и жесты, опираясь на интонацию записи.
40 ₽ за секунду готового видео. Десятисекундный ролик обойдётся в 400 ₽, минутный — в 2400 ₽. Цена одинакова для 720p и 1080p.
Длительность равна длительности загруженной дорожки, отдельного ограничителя в интерфейсе нет. Разработчик заявляет ролики длиннее минуты.
300 символов. Это два-три предложения: кто в кадре, что делает и что вокруг. Операторские детали вроде объектива и движения камеры туда уже не поместятся.
Нет, подойдёт обычный снимок. Важнее не студийное качество, а крупность: чем больше места занимает лицо в кадре, тем аккуратнее прорисовывается артикуляция.
Частота дискретизации сохраняется, но стереодорожка сводится в моно. Для речи разница почти незаметна, для музыки — слышна, поэтому в клипе звук лучше подкладывать отдельно при монтаже.
Разработчик заявляет поддержку животных, антропоморфных и мультяшных персонажей. В нашем тесте мы проверяли только съёмку живого человека.