NNSFWAITool
简体中文

制作案例

成人AI短剧怎么制作?《黄果》的117镜头Wan 2.2工作流

AI短剧剪辑室、镜头时间线与本地GPU工作站

先说结论:《黄果》真正值得拆解的,不是“AI做了成人内容”这个标签,而是它没有把8分钟成片交给一个提示词。制作资料显示,团队把影片拆成117个短镜头,再把人物身份、首帧、动作、对白和后期分别处理。Wan 2.2之所以成为底层,不是因为Seedance画质差,而是这个项目更需要本地权重、可改造流程和持续批量生成的控制权。

数据说明:8分钟、117个镜头、3.2秒中位镜头时长,以及具体的制作步骤,来自为本文提供的《黄果》项目资料。文中外部链接用于核对Wan、Seedance、Wan-S2V和NVIDIA硬件的公开能力,不代表这些厂商验证过《黄果》的私有制作日志。

本文只讨论所有角色均为成年、真人肖像与声音已获得授权的合法制作。未成年人、年龄不明角色和未经同意的色情深度伪造不在可接受范围内。

8分钟目标成片时长
117个独立生成与处理的镜头
3.2秒镜头时长中位数

查看这篇Wan 2.2工作流的英文版

为什么是Wan 2.2,而不是Seedance?

如果只看公开演示,Seedance并不是弱者。ByteDance的官方介绍强调了它对图片、音频和视频参考的支持,以及表演、光影和镜头运动控制。换句话说,它适合需要快速调用成品能力的创作者。

《黄果》面对的却是另一类问题:上百个镜头需要反复抽样;人物身份、动作与对白必须分开调;失败镜头要能回退到任意环节;专用训练资产不能完全受制于一个托管平台。Wan 2.2官方仓库公开了推理代码和模型权重,并提供T2V、I2V、TI2V、S2V等模型入口。这让制作方可以在自己的机器上搭建任务队列,并接入社区的LoRA和训练工具。

制作条件Wan 2.2本地工作流Seedance公开托管服务
模型控制可下载权重和推理代码通过产品或API调用成品能力
本地运行官方提供本地推理方法公开产品页未提供可下载底层权重
LoRA与定向训练可接入社区LoRA训练与全量训练工具公开接口不开放底层训练管线
批量镜头可自建队列、缓存和多机节点受API额度、费用及产品规则影响
成人内容本地执行,制作方承担法律、授权与安全责任火山方舟明确识别并拦截“涉黄”等违规风险
适合什么重控制、可训练、可回退的私有生产线追求便利、强多模态参考与托管能力的常规项目

所以这里不是“Wan画质胜过Seedance”的简单排名。更准确的说法是:Seedance的优势是托管式综合能力;《黄果》需要的是能够占有权重、数据和调度逻辑的生产底座。火山方舟公开的安全体系也明确表示会控制明显违规内容进入与产出,重点识别涉黄风险,这使它无法承担本案例的核心生成任务。

8分钟为什么要拆成117个镜头?

镜头越长,模型需要同时维持的变量越多:脸、手、服装、背景、人物之间的位置、接触关系、运镜和光线都可能漂移。复杂互动里,一个小错误还会随时间放大。短镜头不是为了制造快节奏,而是为了把每次生成压缩成一个能验收的任务。

《黄果》117个镜头按时长分布:84个不超过5秒,23个为5至8秒,4个为8至10秒,6个超过10秒
84+23=107,因此不超过8秒的镜头约占91%,而不是原始资料草稿中写的92%。

一个3至8秒镜头通常只做一件事:完成一个眼神、一次转身、一句对白、一个动作阶段或一次视角变化。复杂场面则拆成全景、近景、局部细节和反应镜头。连续表演并不是模型一次生成出来的,而是在剪辑台上重新建立的。

完整流程:先把故事改写成模型能执行的镜头

从剧本镜头表、角色场景资产、关键帧、Wan视频生成、动作对白到后期质检的六阶段工作流
这条流程的关键不是环节多,而是每个环节都能单独回退和重做。

1. 镜头表要写到“能直接派工”

LLM可以协助整理剧情、人物关系和对白,但它输出的故事稿不能直接进入视频模型。镜头表至少要记录:镜头编号、场景、出场人物、景别、机位、动作、情绪、台词、时长、首帧、结束状态、使用的模型,以及是否需要动作或声音参考。

“两个人在房间里完成一段复杂互动”没有执行价值。制作上要把它拆成进入、靠近、反应、位置变化、局部细节和结束状态。每个镜头只承担一个清晰目标,失败时也容易定位是构图、人物还是动作出了问题。

2. 普通剧情、对白、复杂动作分队列

《黄果》的镜头从分镜阶段就被标成普通剧情、对白、成人内容、复杂动作、环境转场和后期特效。不同类型进入不同队列,分别配置模型、LoRA、采样参数、动作参考和质检标准。把所有镜头塞进同一套预设,看似省事,最后往往会在重试和返工里把时间还回去。

3. 角色LoRA只负责“这个人是谁”

主要角色先建立多角度设定图:正面、侧面、四分之三侧面、表情、不同光线、半身与全身,以及常见服装状态。训练数据里的年龄、脸型、妆容和比例必须互相一致,否则LoRA只会学到一个模糊的平均人物。

角色身份与专用动作能力分开训练。角色LoRA回答“谁在画面里”,内容或动作适配器负责“要完成什么表演”。这样更换人物时不必重训整套动作模型,调整动作模型也不至于把脸一起改掉。这里要注意:Wan官方公开的是权重与推理代码;具体的LoRA训练通常由DiffSynth-Studio等社区工具完成,并不是点击官方界面的一个开关。

4. 重复场景要先锁死空间关系

卧室、客厅、酒店和走廊等重复地点需要自己的参考图库。门窗、家具方向、主光源、色温、墙面材质和可用机位都应固定。人物与床、沙发或墙面的接触越多,空间漂移越容易暴露。场景模板既是美术设定,也是后续姿态与深度控制的坐标系。

先做一张正确的图,再让它动起来

普通剧情镜头先由图片模型生成正式首帧。首帧决定人物身份、服装、构图、光线、场景和动作起点。复杂镜头也先在静态阶段解决人数、相对位置、身体朝向、遮挡、与环境的接触、镜头角度和构图边界。

所有关键帧进入视频模型前都要人工检查。脸、眼睛、手掌、手指、四肢连接、身体比例、服装边缘、家具接触、镜子反射、背景文字和多余物体,能在一张图上修掉就不要留到视频阶段。修一张首帧的成本,远低于逐帧修复同一个结构错误。

成人镜头的三层Wan控制

第一层:关键帧锁定身份、姿态与机位

专用图片模型和适配器先完成经过构图控制的首帧。这个环节解决“谁、在哪里、以什么视角出现”,不给视频模型留下重新设计人物关系的空间。

第二层:Wan 2.2 I2V/TI2V负责时间连续性

通过审核的首帧进入Wan 2.2的I2V或TI2V链路,并按镜头需要调用定向LoRA或微调版本。这一层主要负责动作连续、身份保持、纹理延续、镜头运动和节奏。Wan官方说明TI2V-5B同时支持文本转视频与图片转视频,输出720p、24fps,也能在RTX 4090这类消费级显卡上运行。

第三层:参考视频、姿态与深度负责“怎么动”

复杂动作加入获得授权的参考视频、骨骼姿态序列或深度信息,用来约束轨迹、速度、重心、身体朝向、相对距离和动作起止点。角色LoRA控制身份,动作参考控制移动,场景模板限定空间。三者分工越清楚,人物交换、肢体错位和身体穿透越容易控制。

普通镜头、对白和24→30fps后期

普通镜头:稳定比炫技更有剪辑价值

同一个镜头生成多个候选版本,再检查是否变脸、动作是否符合分镜、视线方向、服装与场景连续性,以及坏帧能否直接切掉。一个运镜简单但完整的镜头,通常比中途变形的炫技镜头更有用。

对白镜头:Wan-S2V或单独口型同步

Wan-S2V的公开项目说明,它可用一张人物图和音频生成同步视频,并同时驱动自然表情、身体运动和镜头表现。对白镜头仍不应该只盯着嘴型:说话前的吸气、句中停顿、眼神、肩颈运动和说完后的反应,才构成一段表演。对不适合S2V的镜头,也可以先生成画面,再在后期做口型同步。

24fps转30fps:先分清重复帧与补帧

制作资料称,Wan素材以24fps生成,最终统一到30fps。若采用最简单的重复帧转换,每秒会从24帧变成30帧,相当于增加6个输出帧,平均每5个输出帧出现1个重复帧。若使用光流或AI补帧,新增的是合成中间帧,规律与风险都不同。

无论哪种方式,都要逐镜头检查手部、头发、人物交叉和快速动作。补帧可能在两张正常原帧之间凭空制造结构错误。进入总剪辑前的常见处理还包括放大、去闪烁、降噪、色彩匹配、曝光统一、局部重绘、坏帧删除和轻微防抖。

声音和剪辑才把117段素材变成一部短剧

视频生成结束,只意味着素材齐了。TTS配音、环境声、动作音效、背景音乐、转场、混音、降噪和响度统一共同建立听觉连续性;字幕、聊天气泡、系统界面、片头和视觉特效负责叙事包装。

最终剪辑要保证人物位置能接上、视线方向正确、服装不跳变、动作在切点连续、对白与嘴型同步、音效落点准确、光线一致,并移除所有失败帧。AI生成的是117段独立素材,剪辑才把它们变成一部8分钟的影片。

制作这类短剧需要什么硬件?

24GB显存:适合验证,不等于高效量产

Wan 2.2官方仓库给出的TI2V-5B示例可以在至少24GB显存的GPU上运行,并通过模型卸载、精度转换和T5放到CPU等方式降低显存需求。这适合测试角色、首帧、提示词和少量镜头。117个合格镜头通常意味着更多失败版本,因此真正的瓶颈很快会变成生成吞吐和人工筛选。

双卡或多机:重点是并行队列

NVIDIA官方规格显示,RTX PRO 6000 Blackwell Workstation Edition拥有96GB GDDR7 ECC显存,最大板卡功耗600W。两张卡合计192GB显存、最大板卡功耗合计1200W;四张卡合计384GB、板卡功耗合计2400W,整机还要加上CPU、内存、硬盘和散热。

但合计显存不是自动共享显存。两张96GB卡不会天然表现成一张192GB卡,只有任务队列、数据并行或模型并行的软件明确利用多卡时,合计资源才有意义。对117镜头项目而言,把不同镜头分发到多台生成节点,往往比堆一台极限主机更灵活。

镜头进入剪辑前的质检表

  • 所有角色均被明确设定并呈现为成年人。
  • 真人肖像、声音、动作素材与训练数据均有授权和来源记录。
  • 没有使用未经同意的真实人物制作色情深度伪造。
  • 人物身份、面部与身体结构符合角色设定。
  • 肢体没有粘连、穿透、异常增生或不符合人体逻辑的运动。
  • 服装、场景布局、光线与相邻镜头连续。
  • 画面没有闪烁、异常纹理、错误文字或破坏性的补帧。
  • 对白、嘴型、表情与音效同步。
  • 帧率、分辨率、色彩和响度规格统一。
  • 输出符合制作地、发布地与发布渠道的法律和规则。

常见问题

成人AI短剧为什么更适合Wan 2.2?

不是所有项目都“更适合”。《黄果》选择Wan 2.2,是因为它需要可下载权重、本地推理、可接入训练工具和自建批量队列。如果项目只做常规内容,Seedance的多模态参考和托管体验也可能更省事。

为什么不用Seedance?

Seedance公开产品是托管式生成服务,火山方舟会执行包括涉黄风险在内的安全拦截;公开接口也不向用户开放底层模型训练管线。因此它不适合作为这个成人内容案例的核心模型。这不等于否定它在常规视频制作中的画质和控制能力。

一部8分钟短剧能一次生成吗?

当前更可靠的方法不是一次生成,而是拆成能单独验收的短镜头。《黄果》用117个镜头完成8分钟叙事,再通过声音与剪辑建立连续性。

Stable Diffusion或Flux还有用吗?

有。图片模型可以承担角色设定、场景参考和关键帧,但视频动作、对白和时间连续性仍需要相应的视频链路与后期。

角色LoRA和内容LoRA应该合并吗?

通常不建议。把身份和动作能力拆开,便于换角色、调动作和排查问题。是否完全分开仍取决于数据规模、训练方法和最终画面要求。

个人电脑能做吗?

可以从24GB显存的TI2V-5B测试开始,但“能跑”与“能按期交付117个合格镜头”是两件事。你还需要足够的存储、生成时间、任务管理和人工质检。

结论:真正的门槛是一条私有生产线

《黄果》的方法可以概括为:LLM整理剧情与镜头表,角色LoRA固定身份,场景模板维持空间,图片模型完成关键帧,Wan 2.2及定向版本生成短镜头,动作参考约束复杂运动,S2V或口型同步处理对白,最后在30fps时间线上完成声音、调色、补帧和剪辑。

Seedance代表强大的托管式视频生成能力;Wan 2.2提供的是权重、推理代码和更大的改造空间。对这个需要合法授权、私有部署和持续批量生产的项目,后者才是决定性的条件。读者可以据此判断哪种路线更符合自己的内容、预算、技术能力和合规边界,而不是照搬一个“最佳模型”答案。

官方资料

帮助我们保持准确

发现参数或链接已经变化?

模型版本、硬件规格和托管平台规则会变。你可以提交更新,我们会核对来源后修改。

报告本文问题