NNSFWAITool
Русский

Как создать короткометражный фильм для взрослых с помощью Wan 2.2: процесс из 117 кадров

Рабочий процесс создания короткометражных фильмов для взрослых Wan 2.2 с использованием ИИ, охватывающий 117 кадров, от планирования до конечного экспорта.

Короткий ответ: интересная часть Хуанго дело не в том, что в этом участвовал ИИ. В том, что создатели фильма не просили одну модель создать восьмиминутный фильм из одной промпты. Согласно производственным примечаниям, предоставленным для этого тематического исследования, они разделили фильм на 117 коротких кадров и контролировали идентичность, ключевые кадры, движение, диалоги и завершение как отдельные проблемы. Wan 2.2 стал основой, потому что проекту требовались локальные веса, модифицируемый конвейер и устойчивое серийное производство, а не потому, что Seedance не хватает визуального качества.

О доказательствах: Восьмиминутное время выполнения, количество кадров 117, средняя длина кадра 3.2 секунды и индивидуальный процесс взяты из производственных материалов Huangguo, предоставленных для этой статьи. Внешние ссылки проверяют общедоступные возможности Wan, Seedance, Wan-S2V и NVIDIA; эти компании не проверили журнал частного производства фильма.

В этой статье рассматривается законное производство, основанное на согласии, с участием только явно взрослых персонажей. Он не поддерживает контент с неоднозначным возрастом, несовершеннолетних или интимные дипфейки без согласия.

8 минутцелевое завершенное время выполнения
117 выстреловгенерируется и обрабатывается отдельно
3.2 секундысредняя продолжительность выстрела

Почему Ван 2.2 вместо Seedance?

Seedance — не самая слабая модель в этом сравнении. На официальной странице ByteDance представлены ссылки на изображения, аудио и видео, а также контроль над производительностью, освещёнием и движением камеры. Для обычного проекта, которому необходимы безупречные возможности хостинга без поддержки локальной инфраструктуры, это может быть большим преимуществом.

У Хуанго был другой набор ограничений. Более ста выстрелов нуждались в повторной выборке. Личность персонажа, движения и диалоги пришлось корректировать независимо. Неудачный бросок нужно было восстанавливать на любом этапе. Студии также необходимо было владеть своими обучающими ресурсами и очередью генерации. Wan 2.2 публикует веса модели и код вывода с путями T2V, I2V, TI2V и S2V, которые можно интегрировать в частную систему рендеринга.

Производственные требованияРабочий процесс локальной глобальной сети 2.2Служба общественных посещёний
Доступ к моделиЗагружаемые веса и код выводаГотовые возможности через размещённые продукты или API
Локальный выводОфициальные локальные инструкции по запускуНа общедоступной странице модели нет загружаемых базовых весов.
LoRA и целевое обучениеМожет подключаться к сообществу LoRA/инструментам полного обучения.Стек обучения базовой модели не отображается через общедоступный интерфейс.
Серийное производствоСамоуправляемые очереди, кэши и многоузловое планированиеВ соответствии с квотами API, ценами и правилами обслуживания.
Контент для взрослыхЛокальное исполнение; производитель несет ответственность за соблюдение закона, согласия и безопасности.Volcano Engine заявляет, что его система безопасности обнаруживает и блокирует порнографические риски
Лучше всёго подходитОбучаемая реверсивная частная производственная линияУдобная мультимодальная генерация для работы в соответствии с политикой

Это решение рабочего процесса, а не универсальный рейтинг качества изображения. Seedance предлагает надежные управляемые услуги. Хуанго нужно было владеть весами, данными и логикой планирования. На собственной странице создания безопасности Volcano Engine также говорится, что ее платформа контролирует явно несоответствующие входные и результаты, уделяя особое внимание риску порнографии, что исключает ее роль центрального генератора в этом случае.

Зачем разбивать восемь минут на 117 бросков?

Более длинные поколения умножают количество вещёй, которые могут дрейфовать: лица, руки, одежда, геометрия фона, контакт между персонажами, освещёние и движение камеры. Небольшая ошибка в сложном взаимодействии может усугубиться за несколько секунд. Короткие кадры не делаются автоматически более быстрыми; они делают каждый рендер тестируемым.

Распределение по длине кадра:84 выстрела за пять секунд или меньше, 23 за пять-восемь секунд, 4 за восемь-десять секунд и 6 за десять секунд.
84 плюс 23 равняется 107, поэтому кадры продолжительностью восемь секунд или меньше составляют около 91%, а не 92%, заявленные в первоначальном варианте производственных заметок.

Кадру продолжительностью от трех до восьми секунд можно поручить одно задание: линия взгляда, поворот, одно предложение, одна фаза движения, изменение угла или вставка детали. Сложные сцены можно перестроить из общих планов, крупных планов, вставок и реакций. Ощущение непрерывной работы создается в монтаже, а не требуется от одного поколения.

Производственная линия начинается с исполняемых кадров

Шестиэтапный процесс: от сценария и списка кадров до идентификационных ресурсов, ключевых кадров, генерации WAN, движения и диалогов, отделки и контроля качества.
Ценность трубопровода не в его сложности; дело в том, что каждый этап можно запустить заново, не перестраивая всю сцену.

1. Превратите скрипт в рабочую базу данных

LLM может помочь организовать сюжет, отношения, диалоги и порядок сцен. Его черновой вариант не является полезной задачей рендеринга. Для каждого кадра требуется идентификатор, декорации, актерский состав, кадрирование, положение камеры, действие, эмоция, диалог, продолжительность, начальное и конечное состояние, маршрут модели, а также любая необходимая ссылка на движение или звук.

«Два персонажа совершают сложное взаимодействие в комнате» — слишком расплывчато. Сцену необходимо разделить на вход, подход, реакцию, изменение позиции, детали и конечное состояние. Это делает неисправности диагностируемыми: композиция, идентичность и движение больше не сводятся к одной и той же проблеме.

2. Направляйте драму, диалоги и сложные движения отдельно

В производственных примечаниях кадры классифицируются как обычное повествование, диалоги, контент для взрослых, сложное движение, окружение/переход или завершение/визуальные эффекты. В каждой категории — свои модели, адаптеры, параметры отбора проб, эталоны и приемочные испытания. Один универсальный пресет выглядит эффективным до тех пор, пока повторные попытки и исправления не сотрут сохранение.

3. Заставьте персонажа LoRA отвечать только «кто это?»

Главным героям нужен чистый идентификационный пакет: спереди, в профиль, вид в три четверти, выражение лица, изменение освещёния, вид в половину тела и в полный рост, а также повторяющиеся состояния гардероба. Возраст, форма лица, макияж и пропорции должны оставаться одинаковыми во всёх данных; в противном случае адаптер запоминает неопределенное среднее значение.

Идентичность и специализированное движение тренируются отдельно. Адаптер символов определяет, кто находится в кадре. Адаптер контента или движения описывает требуемую производительность. Эта модульность позволяет студии заменять персонажа, не переучивая весь стек движений, или улучшать движения, не меняя лица исполнителя.

Важно одно техническое различие: Официальный релиз Вана предоставляет веса и код вывода. Обучение LoRA обычно осуществляется с помощью таких инструментов, как DiffSynth-Studio, который в официальном репозитории указан как интеграция сообщества, поддерживающая LoRA и полное обучение. Это не кнопка, встроенная в размещённый на сервере продукт WAN.

4. Блокируйте повторяющиеся наборы перед рендерингом

Спальни, гостиные, гостиницы и коридоры нуждаются в собственных справочных пакетах. Положения дверей и окон, ориентация мебели, основное освещёние, цветовая температура, материал стен и удобные положения камеры должны быть зафиксированы. Чем больше спектакль взаимодействует с кроватями, диванами или стенами, тем более очевидным становится пространственный дрейф. Установленный шаблон является одновременно эталоном художественного направления и системой координат для последующего управления позой и глубиной.

Создайте правильное неподвижное изображение, прежде чем просить его переместить.

Обычные повествовательные кадры начинаются с утвержденных ключевых кадров. Кадр определяет идентичность, выражение лица, гардероб, композицию, свет, декорации и исходную позу. В более сложных кадрах также учитываются количество персонажей, относительное положение, ориентация тела, окклюзия, контакт с окружающей средой, угол камеры и граница кадра до начала генерации видео.

Каждый ключевой кадр должен быть проверен вручную. Лица, глаза, руки, соединения конечностей, пропорции, края одежды, контакт с мебелью, отражения, фоновый текст и дополнительные объекты дешевле исправить один раз в исходном изображении, чем в десятках видеокадров.

Три уровня управления для специализированных снимков

Слой 1: ключевой кадр фиксирует личность, позу и камеру

Специально созданная модель изображения и адаптеры создают утвержденную открывающую рамку. Этот слой отвечает на вопрос, кто присутствует, где они находятся и как оформлена сцена. Это оставляет меньше возможностей видеомодели для перепроектирования отношений между субъектами.

Слой 2: Wan 2.2 I2V/TI2V управляет временем

Утвержденный кадр поступает на маршрут Wan 2.2 I2V или TI2V с помощью целевых адаптеров или точной настройки, необходимой для этого кадра. Этот уровень отвечает за непрерывность движения, сохранение идентичности, сохранение текстур, движение камеры и синхронизацию. В официальной документации Вана говорится, что TI2V-5B поддерживает преобразование текста в видео и изображение в видео с разрешением 720p и 24 кадра в секунду и может работать на потребительском графическом процессоре, таком как RTX 4090.

Слой 3: лицензионные ссылки описывают, как движется действие

К сложным движениям можно добавить авторизованное эталонное видео, последовательности поз скелета или информацию о глубине. Эти входные данные ограничивают траекторию, скорость, смещёние веса, ориентацию, расстояние и начальное/конечное состояние. Адаптеры идентификации контролируют исполнителя; ссылки управляют движением; заданный шаблон ограничивает пространство. Разделение этих обязанностей уменьшает переключение персонажей, пересечения тел и нестабильный контакт.

Обычные кадры, диалоги и финиш со скоростью 24–30 кадров в секунду.

Для обычных кадров возможность редактирования важнее зрелищности

Создайте несколько кандидатов, затем проверьте идентичность, соответствие раскадровки, линию взгляда, целостность гардероба, непрерывность набора и возможность аккуратного вырезания плохих кадров. Сдержанный кадр, сохраняющийся от первого до последнего кадра, более ценен, чем амбициозное движение камеры, которое меняется на полпути.

Диалог: Wan-S2V или отдельный проход синхронизации губ

Официальный проект Wan-S2V описывает модель, которая превращает одно изображение плюс звук в синхронизированное видео с естественными выражениями лиц, движениями тела и кинематографическим поведением камеры. Полезный диалоговый кадр по-прежнему включает в себя нечто большее, чем просто форму рта. Дыхание перед речью, паузы, движение глаз, поза и реакция после реплики делают выступление правдоподобным. Если S2V не является правильным маршрутом, команда может сначала создать визуальный снимок и применить синхронизацию губ при публикации.

От 24 до 30 кадров в секунду: дублированные кадры не являются интерполяцией

В производственных примечаниях говорится, что исходные клипы Wan были созданы со скоростью 24 кадра в секунду и соответствовали мастеру с частотой 30 кадров в секунду. Базовое преобразование дублирования добавляет шесть выходных кадров в секунду или один повторяющийся кадр на каждые пять выходных кадров. Вместо этого интерполяция оптического потока или ИИ создает синтетические промежуточные кадры и имеет другой шаблон артефактов.

Любой метод требует проверки на уровне выстрела. Руки, волосы, перекрывающиеся фигуры и быстрое движение могут привести к новым структурным ошибкам между исходными кадрами, которые в противном случае можно было бы использовать. Обработка также включала масштабирование, устранение мерцания, шумоподавление, согласование цветов, коррекцию экспозиции, локальную перерисовку, удаление неудачных кадров и стабилизацию освещёния.

Звук и монтаж превращают 117 клипов в один фильм

Завершение создания видео означает, что исходный материал существует. Диалоги TTS, атмосфера, звук действия, музыка, переходы, микширование, шумоподавление и нормализация громкости создают слуховую непрерывность. Субтитры, графические сообщения, системные интерфейсы, титры и сдержанные визуальные эффекты несут повествовательную упаковку.

Окончательный монтаж должен сохранить направление экрана, линию взгляда, гардероб, установленное освещёние, действие в монтажной сцене, синхронизацию губ и синхронизацию звука, удаляя при этом каждый неудачный кадр. AI произвела 117 отдельных штук. Монтаж заставил их почувствовать себя восьмиминутным короткометражным фильмом.

Какое оборудование требуется для этого рабочего процесса?

24 ГБ видеопамяти: достаточно для проверки, не обязательно для масштабной реализации

Официальная команда Вана TI2V-5B может работать как минимум с 24 ГБ видеопамяти за счет разгрузки модели, преобразования dtype и размещёния ЦП для T5. Это полезно для тестов персонажей, быстрой разработки, ключевых кадров и ограниченных клипов. Доставка 117 выстрелов — это проблема пропускной способности: за каждым одобренным выстрелом может стоять несколько отклоненных попыток.

Двойной графический процессор или несколько узлов: параллельные очереди важнее всёго

NVIDIA указывает 96 ГБ памяти GDDR7 ECC и максимальную мощность платы 600 Вт для RTX PRO 6000 Blackwell Workstation Edition. Таким образом, две карты представляют собой 192 ГБ совокупной видеопамяти и максимальную мощность платы 1,200 Вт; четыре представляют собой 384 ГБ и 2,400 Вт без учета процессора, хранилища, памяти и охлаждения.

Совокупная видеопамять не является автоматически одним пулом общей памяти. Две карты емкостью 96 ГБ по своей сути не ведут себя как одна карта емкостью 192 ГБ. Чтобы получить выгоду, программное обеспечение должно использовать параллелизм данных, параллелизм моделей или отдельные задания рендеринга. Для 117 кадров распределение независимых заданий по нескольким узлам зачастую оказывается более гибким, чем построение одной крайней рабочей станции.

Контрольный список качества и прав на уровне кадра

  • Каждый изображенный персонаж четко определен и представлен взрослым.
  • Лица, голоса, отсылки к движениям и данные обучения имеют документально подтвержденную авторизацию и происхождение.
  • Ни один реальный человек не появляется в интимном дипфейковом контенте без согласия.
  • Личность, лицо и строение тела соответствуют утвержденному дизайну персонажа.
  • Здесь нет сросшихся конечностей, пересечений, необъяснимой анатомии или физически бессвязных движений.
  • Гардероб, геометрия декораций, освещёние и направление экрана продолжаются на соседних кадрах.
  • Удалены мерцание, сбои текстур, ложный текст и деструктивные интерполированные кадры.
  • Диалоги, мимика и звуки действий синхронизированы.
  • Частота кадров, разрешение, цвет и громкость соответствуют основным спецификациям.
  • Продукция соответствует законам и правилам платформы как в местах производства, так и в местах распространения.

Часто задаваемые вопросы

Почему «Ван 2.2» лучше подходит для короткометражного фильма об искусственном интеллекте для взрослых?

Это не значит, что каждый фильм становится лучше автоматически. Хуанго требовались загружаемые веса, локальные логические выводы, внешние инструменты обучения и самоуправляемые очереди. Для обычного контента, соответствующего политике, мультимодальный процесс Seedance может быть проще.

Почему бы не использовать Сиданс?

Seedance публично предлагается как хостинговая служба генерации, а Volcano Engine документирует проверки безопасности, включающие порнографический риск. Его общедоступный интерфейс также не предоставляет конечным пользователям доступ к стеку обучения базовой модели. Это делает его несовместимым с этим конкретным конвейером контента для взрослых, не умаляя при этом его преимуществ для обычного кинопроизводства.

Можно ли создать восьмиминутный фильм с искусственным интеллектом за один проход?

Рабочий процесс, основанный на кадрах, в настоящее время легче контролировать и ремонтировать. Хуанго использовал 117 независимо проверенных кадров, а затем применил монтаж и звук, чтобы добиться непрерывности.

Имеет ли значение стабильная диффузия или поток?

Да. Модели изображений остаются полезными для поворотов персонажей, ссылок на наборы и ключевых кадров. Видеомодели и пост-продакшн обрабатывают движение, диалог и временную непрерывность.

Следует ли объединить LoRA персонажей и контента?

Обычно нет. Отделение идентификации от возможностей движения или контента упрощает замену, переобучение и отладку. Окончательный дизайн по-прежнему зависит от размера набора данных и метода обучения.

Может ли персональный компьютер сделать это?

Он может начаться с TI2V-5B на графическом процессоре объемом 24 ГБ. Однако «может визуализировать клип» и «может сделать 117 одобренных кадров по графику» — это разные пороговые значения. Хранение, повторные попытки, управление очередями и человеческий контроль становятся одинаково важными.

Настоящим барьером является частная производственная линия.

Метод Хуанго можно резюмировать следующим образом: структурируйте историю как исполняемые кадры; блокировка личности с помощью адаптеров символов; сохраняйте пространство с помощью установленных шаблонов; утверждать ключевые кадры; анимировать короткие клипы с помощью Wan 2.2 и целевых вариантов; управляйте сложным движением с помощью лицензионных ссылок; направлять диалог через S2V или синхронизацию губ; затем закончить звук, cцвет, интерполяция и редактирование на временной шкале 30 кадров в секунду.

Seedance представляет собой мощное создание размещённого видео. Wan 2.2 предоставляет веса, код вывода и больше возможностей для модификации системы. Для этого законного, авторизованного проекта – с его упором на конфиденциальность и повторяющееся серийное производство – это различие имело решающее значение. Сравнение призвано помочь читателям оценить, какой маршрут соответствует их собственному контенту, бюджету, техническим навыкам и обязательствам по соблюдению требований, а не выдавать одну универсальную «лучшую модель».

Официальные источники