Wan 3.0 — флагманская видеомодель Alibaba: собирает ролик до 30 секунд со звуком из текста и референсов. В одну задачу помещается до 10 изображений, до 5 видео и до 5 аудиозаписей — модель переносит из них внешность героев, движение камеры и звучание.
Референсы адресуются прямо в промпте по номерам: «герой с Image 1 идёт по улице из Video 1» — порядок совпадает с порядком загрузки. Так серия роликов с одним персонажем и единой манерой съёмки перестаёт быть лотереей.
Видео от 2 до 30 секунд в 480p, 720p или 1080p со звуком — по тексту или по референсам. В референсы можно отдать изображения героев, ролики с нужным движением камеры и аудио с голосом или музыкой.
Загрузите до 10 изображений, до 5 видео (суммарно до 15 секунд) и до 5 аудиозаписей (тоже до 15 секунд) и ссылайтесь на них в промпте по номерам: Image 1, Video 1, Audio 1 — в порядке загрузки.
Нет. Выберите модель в селекторе на этой странице: запрос уходит с нашей стороны, зарубежная карта не нужна, промпт можно писать по-русски.
Есть бесплатный старт — токены выдаются после регистрации. Дальше подписка от 390 ₽/мес: она открывает все модели генерации видео, изображений и чат с ИИ. Оплата российской картой, без VPN.