Видео со звуком по тексту, фото и референсам — одним прогоном без монтажа
Wan 3.0 — новая видео-модель Alibaba: ролики до 30 секунд со звуком одним прогоном — по тексту, из фото и по референсам. Опишите сцену, остальное модель соберёт сама.
Короткая версия: ролики вдвое длиннее прежних версий, звук рождается прямо в кадре, а референсы задают героя, движение и даже звучание. Wan 3.0 вышла в августе 2026 года: открытая версия — 6 августа, полный доступ — 24 августа.
Раньше в линейке Wan под каждую задачу был отдельный режим: видео по тексту, оживление фото, работа с референсами. В 3.0 это одна модель — она сама понимает по вашим входам, что делать: написали сцену — снимет её с нуля, добавили портрет — оживит, приложили ролик-образец — повторит манеру движения.
Персонажи стали заметно устойчивее: лицо героя держится от первого кадра до финального, а массовка в кадре разнообразна — близнецы-статисты больше не ловятся глазом. Попробовать модель можно в разделе Видео рядом с остальными топами каталога.
Реплика в кавычках прямо в промпте — и герой произносит её в кадре: речь, интонация и попадание в губы генерируются вместе с видео. Вертикальный формат и живая подача — готовый ролик для ленты без студии, актёра и монтажа.
Опишите героя подробно — возраст, одежда, манера — и модель удержит его образ на всю длину ролика.
Рабочая формула: субъект → действие → место и свет → камера → звук. Одно предложение на каждый элемент — и модель соберёт сцену без сюрпризов.
Несколько правил, которые заметно поднимают качество:
Если эффектная фраза не рождается — начните с простой сцены и усложняйте её от прогона к прогону: так вы быстрее поймёте характер модели, чем переписывая один длинный промпт.
| Wan 3.0 | Kling 3.0 | Seedance 2.5 | |
|---|---|---|---|
| Максимум одним роликом | 30 секунд | 15 секунд | 30 секунд |
| Свой звук как образец | да | нет | нет |
| Модель сама подбирает длительность | да | нет | нет |
| Максимальное качество | Full HD | 4K | Full HD |
Сильнее всего модель играет там, где нужен длинный связный ролик со звуком без монтажа. Три типичных сценария.
Селлеру на маркетплейсе — видеообложка карточки: снимите товар на телефон, загрузите фото первым кадром и опишите облёт камеры. Вертикальный формат готов для карточки, а звук — щелчок затвора, шорох ткани — уже внутри.
SMM-специалисту — рилсы полного цикла: длины хватает на завязку, развитие и финал одним прогоном, без склейки трёх коротких кусков. Референсы держат героя и стиль от ролика к ролику — серия выглядит единой рубрикой.
Маркетологу и малому бизнесу — рекламные креативы: несколько вертикальных роликов с разной подачей за вечер вместо съёмочного дня. Меняйте героя, реплику и сцену прямо в промпте и тестируйте, что цепляет аудиторию.
Загрузите до 10 фото товара — модель удержит форму, фактуру и цвет и снимет распаковку, обзор или демонстрацию в руках. До 5 видео-образцов зададут манеру движения, до 5 аудио — голос и настроение звука.
Кадры-референсы удобно подготовить заранее в разделе Изображения — они сохранятся в вашей галерее.
По-честному: слабое место Wan 3.0 — текст в кадре. Вывески, упаковки и титры модель рисует с ошибками на любом языке, поэтому надписи добавляйте поверх готового ролика в редакторе.
Ещё три вещи, которые сэкономят вам попытки:
Это не приговор, а карта: зная границы, вы получаете предсказуемый результат с первой-второй попытки, а не тратите генерации на переделки.
Откройте Star AI — сервис работает из России без VPN, оплата российской картой. Зарегистрируйтесь, выберите Wan 3.0 в разделе Видео, опишите сцену или загрузите фото — готовый ролик появится в вашей галерее. Интерфейс полностью на русском — от настроек формата до истории генераций.
Для знакомства — да: после регистрации вы получаете стартовые токены и можете попробовать генерацию без оплаты. Для регулярной работы понадобится подписка: она открывает полный каталог видео-моделей и ежемесячный запас токенов. Отменить подписку можно в любой момент в пару кликов.
Да — описывайте сцену по-русски, модель понимает сложные сценарии без перевода. Речь героев тоже может звучать по-русски: попросите реплику прямо в промпте. Слабое место — надписи в кадре: их модель рисует с ошибками на любом языке, титры надёжнее добавить в редакторе.
Да — загрузите портрет первым кадром и опишите движение: поворот головы, улыбка, взгляд в камеру. Можно задать и финальный кадр — переход модель построит сама. Чтобы сходство не терялось, просите умеренное движение: на спокойных сценах лицо держится заметно лучше.
Wan 3.0 делает до 30 секунд одним прогоном, сама подбирает длительность под сценарий и единственная в каталоге принимает ваш звук как образец. Kling 3.0 отвечает качеством до 4K и кинематографичной картинкой, Seedance 2.5 тоже тянет полминуты. Все три есть в Star AI — выбирайте под задачу.
На официальном сайте Wan бесплатные генерации выходят с водяным знаком и живой очередью. В Star AI готовый ролик скачивается чистым, в исходном качестве — его можно сразу ставить в рекламу, карточку товара или соцсети без дополнительной обработки.
Информация обновлена: 25 августа 2026