Разбираем модели Kling AI Avatar 2.0 от VeoSuno: как быстро оживить фотографию с помощью звуковой дорожки, чем отличается версия pro от standart и сколько стоит генерация видео.
Kling AI Avatar 2.0 делает из фотографии и звуковой дорожки говорящего героя. Модель существует в двух версиях, pro и standart, и различаются они ровно одним параметром — разрешением.
Особенность этой пары в другом: настраивать здесь практически нечего. Загружаете снимок, загружаете аудио, пишете описание сцены — и всё.
В интерфейсе всего три поля: изображение, аудио и описание сцены.
Ни слайдера длительности, ни выбора соотношения сторон, ни переключателя разрешения внутри модели. Формат ролика наследуется от пропорций снимка, длина — от длины дорожки, а разрешение вы выбираете в момент, когда решаете между standart и pro.
Ошибиться тут негде, но и подкрутить нечего. Единственный рычаг — сам исходный кадр и текст промпта.
Ещё одно ограничение стоит держать в голове: поле промпта вмещает 2500 символов. Для описания сцены этого с запасом, но детальную раскадровку по секундам, как в моделях для генерации с нуля, сюда уже не поместить.
Мы взяли фирменный трек VeoSuno с женским вокалом, вырезали припев и привели файл ровно к десяти секундам.
Пример звуковой дорожки для оживления фото:
Фотография — вертикальный кадр 2:3, диджей за пультом на фоне неоновой вывески.
Промпт описывал не речь, а сцену вокруг неё:
A blonde DJ with tattooed arms stands behind her mixer and sings the chorus straight into the room, chin lifting slightly on the long notes. Her head and shoulders move with the beat, her right hand rests on the mixer, her left hand rides a fader. Behind her the neon VeoSuno sign glows and thin laser lines drift across the wall, haze moving slowly through the light. The camera pushes in a few centimetres, very slowly, and settles. Shot on a 50mm lens, shallow depth of field, natural film grain, soft bloom around the neon, warm practical light on her face, real skin texture with visible pores and stray hairs, her braided strands swaying slightly. Cinematic music video look, not a 3D render, not a video game.
Сначала прогнали через standart. Ролик 784×1168, 160 ₽:
Затем через pro с теми же файлами и тем же промптом. Ролик 1168×1760, 320 ₽:
Разрешение отрабатывает доплату. У pro картинка ощутимо детальнее: читается фактура кожи, рисунок татуировок на руках, надпись на футболке. У standart всё это заметно мягче, особенно на лице, которое в общем плане занимает малую часть кадра.
Камера слушается промпта. Обе версии отработали медленный наезд: к финалу героиня в кадре крупнее, напольные колонки из кадра уходят. Для моделей липсинка это не само собой разумеющееся.
Звук сохраняется без потерь. Мы загружали стерео 44,1 кГц и получили ровно его же. Для клипа это принципиально: пережатая дорожка обесценила бы всю работу над треком.
А вот с мимикой модель самовольничает. На исходной фотографии героиня смотрит в камеру спокойно, почти строго. В обоих роликах она широко улыбается, а глаза значительную часть хронометража закрыты — ни в снимке, ни в промпте этого нет, модель добавила настроение от себя. У pro первые секунды ближе к оригиналу, дальше расхождение растёт.
Черты лица плывут. Овал, скулы и подбородок к концу ролика отличаются от исходных. Героиня узнаётся, но это уже слегка другой человек. У standart расхождение сильнее, у pro мягче.
Совет: если для вас важно точное портретное сходство, берите фотографию, где лицо занимает больше места в кадре, и не рассчитывайте на длинный ролик — чем дольше идёт генерация, тем дальше уходит лицо от оригинала.
Цена считается за секунду готового ролика:
| Версия | Разрешение | За секунду | Ролик на 10 секунд |
|---|---|---|---|
| standart | 720p | 16 ₽ | 160 ₽ |
| pro | 1080p | 32 ₽ | 320 ₽ |
Зависимость линейная, скидок за длину нет. Ролик на минуту в standart обойдётся в 960 ₽, в pro — в 1920 ₽.
Отсюда рабочий порядок: сначала короткий прогон в standart, чтобы проверить, как модель обходится с вашим лицом и попадает ли артикуляция в звук, и только потом полная версия в pro.
Обе версии доступны в каталоге — Kling AI Avatar 2.0 standart и Kling AI Avatar 2.0 pro.
Дорожку необязательно записывать самому: трек можно собрать с нуля, сделать кавером готовой песни или вырастить из собственной демозаписи.
Остальные модели раздела мы прогнали на том же фото и той же дорожке, так что результаты можно сравнить самому: MiniMax H3 avatars, InfiniteTalk AI, OmniHuman 1.5. Если раньше не работали с генерацией видео, начните с общего гайда.
Kling AI Avatar 2.0 — модель, которая делает из фотографии и звуковой дорожки говорящего героя. Существует в двух версиях: standart в 720p и pro в 1080p.
Разрешением и ценой. Pro выдаёт 1080p и стоит 32 ₽ за секунду, standart — 720p за 16 ₽. Набор настроек и логика работы у версий одинаковые.
Десять секунд обойдутся в 160 ₽ в версии standart и в 320 ₽ в pro. Зависимость линейная, скидок за длину нет: минута стоит 960 ₽ и 1920 ₽ соответственно.
Длительность равна длительности загруженной дорожки, отдельного ползунка нет. У версии pro заявлены ролики до пяти минут.
2500 символов. Этого хватает на подробное описание героя, обстановки и движения камеры, но детальную раскадровку по секундам сюда уже не поместить.
Да, обе версии выполняют указания о движении камеры из промпта. В нашем тесте медленный наезд отработал: к финалу героиня в кадре заметно крупнее.
Дорожка сохраняется как есть, включая стерео и частоту дискретизации. Обе версии выдают видео с 30 кадрами в секунду.