先說結論:《黃果》真正值得拆解的,不是“AI做了成人內容”這個標簽,而是它沒有把8分鐘成片交給一個提示詞。製作資料顯示,團隊把影片拆成117個短鏡頭,再把人物身份、首個影格、動作、對白和后期分別處理。Wan 2.2之所以成為底層,不是因為Seedance畫質差,而是這個項目更需要本機權重、可改造流程和持續批量生成的控制權。
資料說明:8分鐘、117個鏡頭、3.2秒中位鏡頭時長,以及具體的製作步驟,來自為本文提供的《黃果》項目資料。文中外部連結用於核對Wan、Seedance、Wan-S2V和NVIDIA硬體的公開能力,不代表這些廠商驗證過《黃果》的私有製作日志。
本文只討論所有角色均為成年、真人肖像與聲音已獲得授權的合法製作。未成年人、年齡不明角色和未經同意的色情深度偽造不在可接受范圍內。
為什麼是Wan 2.2,而不是Seedance?
如果只看公開演示,Seedance並不是弱者。ByteDance的官方介紹強調了它對圖片、音頻和影片參考的支援,以及表演、光影和鏡頭運動控制。換句話說,它適合需要快速呼叫成品能力的創作者。
《黃果》面對的卻是另一類問題:上百個鏡頭需要反復抽樣;人物身份、動作與對白必須分開調;失敗鏡頭要能回退到任意環節;專用訓練資產不能完全受制于一個托管平臺。Wan 2.2官方倉庫公開了推理程式碼和模型權重,並提供T2V、I2V、TI2V、S2V等模型入口。這讓製作方可以在自己的機器上搭建任務佇列,並接入社區的LoRA和訓練工具。
| 製作條件 | Wan 2.2本機工作流程 | Seedance公開托管服務 |
|---|---|---|
| 模型控制 | 可下載權重和推理程式碼 | 通過產品或API呼叫成品能力 |
| 在本機執行 | 官方提供本機推論方法 | 公開產品頁未提供可下載底層權重 |
| LoRA與定向訓練 | 可接入社區LoRA訓練與全量訓練工具 | 公開介面不開放底層訓練管線 |
| 批量鏡頭 | 可自建佇列、快取和多機節點 | 受API額度、費用及產品規則影響 |
| 成人內容 | 在本機執行,製作方承擔法律、授權與安全責任 | 火山方舟明確識別並攔截“涉黃”等違規風險 |
| 適合什麼 | 重控制、可訓練、可回退的私有生產線 | 追求便利、強多模態參考與托管能力的常規項目 |
所以這里不是“Wan畫質勝過Seedance”的簡單排名。更準確的說法是:Seedance的優勢是托管式綜合能力;《黃果》需要的是能夠占有權重、資料和調度邏輯的生產底座。火山方舟公開的安全體系也明確表示會控制明顯違規內容進入與產出,重點識別涉黃風險,這使它無法承擔本案例的核心生成任務。
8分鐘為什麼要拆成117個鏡頭?
鏡頭越長,模型需要同時維持的變量越多:臉、手、服裝、背景、人物之間的位置、接觸關系、運鏡和光線都可能漂移。復雜互動里,一個小錯誤還會隨時間放大。短鏡頭不是為了制造快節奏,而是為了把每次生成壓縮成一個能驗收的任務。
一個3至8秒鏡頭通常只做一件事:完成一個眼神、一次轉身、一句對白、一個動作階段或一次視角變化。復雜場面則拆成全景、近景、局部細節和反應鏡頭。連續表演並不是模型一次生成出來的,而是在剪輯臺上重新建立的。
完整流程:先把故事改寫成模型能執行的鏡頭
1. 鏡頭表要寫到“能直接派工”
LLM可以協助整理劇情、人物關系和對白,但它輸出的故事稿不能直接進入影片模型。鏡頭表至少要記錄:鏡頭編號、場景、出場人物、景別、機位、動作、情緒、臺詞、時長、首個影格、結束狀態、使用的模型,以及是否需要動作或聲音參考。
“兩個人在房間里完成一段復雜互動”沒有執行價值。製作上要把它拆成進入、靠近、反應、位置變化、局部細節和結束狀態。每個鏡頭只承擔一個清晰目標,失敗時也容易定位是構圖、人物還是動作出了問題。
2. 普通劇情、對白、復雜動作分佇列
《黃果》的鏡頭從分鏡階段就被標成普通劇情、對白、成人內容、復雜動作、環境轉場和后期特效。不同類型進入不同佇列,分別配置模型、LoRA、取樣參數、動作參考和質檢標準。把所有鏡頭塞進同一套預設,看似省事,最后往往會在重試和返工里把時間還回去。
3. 角色LoRA只負責“這個人是誰”
主要角色先建立多角度設定圖:正面、側面、四分之三側面、表情、不同光線、半身與全身,以及常見服裝狀態。訓練資料里的年齡、臉型、妝容和比例必須互相一致,否則LoRA只會學到一個模糊的平均人物。
角色身份與專用動作能力分開訓練。角色LoRA回答“誰在畫面里”,內容或動作適配器負責“要完成什麼表演”。這樣更換人物時不必重訓整套動作模型,調整動作模型也不至于把臉一起改掉。這里要注意:Wan官方公開的是權重與推理程式碼;具體的LoRA訓練通常由DiffSynth-Studio等社區工具完成,並不是點擊官方界面的一個開關。
4. 重復場景要先鎖死空間關系
臥室、客廳、酒店和走廊等重復地點需要自己的參考圖庫。門窗、家具方向、主光源、色溫、墻面材質和可用機位都應固定。人物與床、沙發或墻面的接觸越多,空間漂移越容易暴露。場景模板既是美術設定,也是后續姿態與深度控制的坐標系。
先做一張正確的圖,再讓它動起來
普通劇情鏡頭先由圖片模型生成正式首個影格。首個影格決定人物身份、服裝、構圖、光線、場景和動作起點。復雜鏡頭也先在靜態階段解決人數、相對位置、身體朝向、遮擋、與環境的接觸、鏡頭角度和構圖邊界。
所有關鍵影格進入影片模型前都要人工檢查。臉、眼睛、手掌、手指、四肢連接、身體比例、服裝邊緣、家具接觸、鏡子反射、背景文字和多余物體,能在一張圖上修掉就不要留到影片階段。修一張首個影格的成本,遠低于逐影格修復同一個結構錯誤。
成人鏡頭的三層Wan控制
第一層:關鍵影格鎖定身份、姿態與機位
專用圖片模型和適配器先完成經過構圖控制的首個影格。這個環節解決“誰、在哪里、以什麼視角出現”,不給影片模型留下重新設計人物關系的空間。
第二層:Wan 2.2 I2V/TI2V負責時間連續性
通過審核的首個影格進入Wan 2.2的I2V或TI2V鏈路,並按鏡頭需要呼叫定向LoRA或微調版本。這一層主要負責動作連續、身份保持、紋理延續、鏡頭運動和節奏。Wan官方說明TI2V-5B同時支援文本轉影片與圖片轉影片,輸出720p、24fps,也能在RTX 4090這類消費級顯卡上運行。
第三層:參考影片、姿態與深度負責“怎麼動”
復雜動作加入獲得授權的參考影片、骨骼姿態序列或深度資訊,用來約束軌跡、速度、重心、身體朝向、相對距離和動作起止點。角色LoRA控制身份,動作參考控制移動,場景模板限定空間。三者分工越清楚,人物交換、肢體錯位和身體穿透越容易控制。
普通鏡頭、對白和24→30fps后期
普通鏡頭:穩定比炫技更有剪輯價值
同一個鏡頭生成多個候選版本,再檢查是否變臉、動作是否符合分鏡、視線方向、服裝與場景連續性,以及壞影格能否直接切掉。一個運鏡簡單但完整的鏡頭,通常比中途變形的炫技鏡頭更有用。
對白鏡頭:Wan-S2V或單獨口型同步
Wan-S2V的公開項目說明,它可用一張人物圖和音頻生成同步影片,並同時驅動自然表情、身體運動和鏡頭表現。對白鏡頭仍不應該只盯著嘴型:說話前的吸氣、句中停頓、眼神、肩頸運動和說完后的反應,才構成一段表演。對不適合S2V的鏡頭,也可以先生成畫面,再在后期做口型同步。
24fps轉30fps:先分清重復影格與補影格
製作資料稱,Wan素材以24fps生成,最終統一到30fps。若采用最簡單的重復影格轉換,每秒會從24影格變成30影格,相當于增加6個輸出影格,平均每5個輸出影格出現1個重復影格。若使用光流或AI補影格,新增的是合成中間影格,規律與風險都不同。
無論哪種方式,都要逐鏡頭檢查手部、頭發、人物交叉和快速動作。補影格可能在兩張正常原影格之間憑空制造結構錯誤。進入總剪輯前的常見處理還包括放大、去閃爍、降噪、色彩匹配、曝光統一、局部重繪、壞影格刪除和輕微防抖。
聲音和剪輯才把117段素材變成一部短劇
影片生成結束,只意味著素材齊了。TTS配音、環境聲、動作音效、背景音樂、轉場、混音、降噪和響度統一共同建立聽覺連續性;字幕、聊天氣泡、系統界面、片頭和視覺特效負責敘事包裝。
最終剪輯要保證人物位置能接上、視線方向正確、服裝不跳變、動作在切點連續、對白與嘴型同步、音效落點準確、光線一致,並移除所有失敗影格。AI生成的是117段獨立素材,剪輯才把它們變成一部8分鐘的影片。
製作這類短劇需要什麼硬體?
24GB顯示記憶體:適合驗證,不等于高效量產
Wan 2.2官方倉庫給出的TI2V-5B示例可以在至少24GB顯示記憶體的GPU上運行,並通過模型解除安裝、精度轉換和T5放到CPU等方式降低顯示記憶體需求。這適合測試角色、首個影格、提示詞和少量鏡頭。117個合格鏡頭通常意味著更多失敗版本,因此真正的瓶頸很快會變成生成吞吐和人工篩選。
雙卡或多機:重點是並行佇列
NVIDIA官方規格顯示,RTX PRO 6000 Blackwell Workstation Edition擁有96GB GDDR7 ECC顯示記憶體,最大板卡功耗600W。兩張卡合計192GB顯示記憶體、最大板卡功耗合計1200W;四張卡合計384GB、板卡功耗合計2400W,整機還要加上CPU、記憶體、硬盤和散熱。
但合計顯示記憶體不是自動共享顯示記憶體。兩張96GB卡不會天然表現成一張192GB卡,只有任務佇列、資料並行或模型並行的軟體明確利用多卡時,合計資源才有意義。對117鏡頭項目而言,把不同鏡頭分發到多臺生成節點,往往比堆一臺極限主機更靈活。
鏡頭進入剪輯前的質檢表
- 所有角色均被明確設定並呈現為成年人。
- 真人肖像、聲音、動作素材與訓練資料均有授權和來源記錄。
- 沒有使用未經同意的真實人物製作色情深度偽造。
- 人物身份、面部與身體結構符合角色設定。
- 肢體沒有粘連、穿透、異常增生或不符合人體邏輯的運動。
- 服裝、場景布局、光線與相鄰鏡頭連續。
- 畫面沒有閃爍、異常紋理、錯誤文字或破壞性的補影格。
- 對白、嘴型、表情與音效同步。
- 影格率、解析度、色彩和響度規格統一。
- 輸出符合製作地、發布地與發布渠道的法律和規則。
常見問題
成人AI短劇為什麼更適合Wan 2.2?
不是所有項目都“更適合”。《黃果》選擇Wan 2.2,是因為它需要可下載權重、本機推論、可接入訓練工具和自建批量佇列。如果項目只做常規內容,Seedance的多模態參考和托管體驗也可能更省事。
為什麼不用Seedance?
Seedance公開產品是托管式生成服務,火山方舟會執行包括涉黃風險在內的安全攔截;公開介面也不向使用者開放底層模型訓練管線。因此它不適合作為這個成人內容案例的核心模型。這不等于否定它在常規影片製作中的畫質和控制能力。
一部8分鐘短劇能一次生成嗎?
當前更可靠的方法不是一次生成,而是拆成能單獨驗收的短鏡頭。《黃果》用117個鏡頭完成8分鐘敘事,再通過聲音與剪輯建立連續性。
Stable Diffusion或Flux還有用嗎?
有。圖片模型可以承擔角色設定、場景參考和關鍵影格,但影片動作、對白和時間連續性仍需要相應的影片鏈路與后期。
角色LoRA和內容LoRA應該合並嗎?
通常不建議。把身份和動作能力拆開,便于換角色、調動作和排查問題。是否完全分開仍取決于資料規模、訓練方法和最終畫面要求。
個人電腦能做嗎?
可以從24GB顯示記憶體的TI2V-5B測試開始,但“能跑”與“能按期交付117個合格鏡頭”是兩件事。你還需要足夠的存儲、生成時間、任務管理和人工質檢。
結論:真正的門檻是一條私有生產線
《黃果》的方法可以概括為:LLM整理劇情與鏡頭表,角色LoRA固定身份,場景模板維持空間,圖片模型完成關鍵影格,Wan 2.2及定向版本生成短鏡頭,動作參考約束復雜運動,S2V或口型同步處理對白,最后在30fps時間線上完成聲音、調色、補影格和剪輯。
Seedance代表強大的托管式影片生成能力;Wan 2.2提供的是權重、推理程式碼和更大的改造空間。對這個需要合法授權、私有部署和持續批量生產的項目,后者才是決定性的條件。讀者可以據此判斷哪種路線更符合自己的內容、預算、技術能力和合規邊界,而不是照搬一個“最佳模型”答案。