الجواب القصير: الجزء المثير للاهتمام من هوانغجو ليس أن منظمة العفو الدولية كانت متورطة. المشكلة هي أن صانعي الأفلام لم يطلبوا من عارضة واحدة أن تصنع فيلمًا مدته ثماني دقائق من موجه واحد. وفقًا لملاحظات الإنتاج المقدمة لدراسة الحالة هذه، فقد قاموا بتقسيم الفيلم إلى لقطات قصيرة 117 والهوية المتحكم فيها والإطارات الرئيسية والحركة والحوار والتشطيب كمشكلات منفصلة. كان Wan 2.2 هو الأساس لأن المشروع كان يحتاج إلى أوزان محلية، وخط أنابيب قابل للتعديل، وإنتاج دفعي مستدام - وليس لأن Seedance يفتقر إلى الجودة المرئية.
حول الأدلة: وقت التشغيل الذي يبلغ ثماني دقائق، وعدد لقطات 117، ومتوسط طول اللقطة 3.2 ثانية، والعملية الخاصة بالمشروع تأتي من مواد إنتاج Huangguo المتوفرة لهذه المقالة. تتحقق الروابط الخارجية من قدرات Wan وSeedance وWan-S2V العامة وNVIDIA؛ لم تتحقق هذه الشركات من سجل الإنتاج الخاص للفيلم.
تتناول هذه المقالة الإنتاج القانوني القائم على الموافقة والذي يتضمن شخصيات للبالغين فقط. إنها لا تؤيد المحتوى الغامض للعمر، أو القاصرين، أو التزييف العميق الحميم غير التوافقي.
لماذا Wan 2.2 بدلاً من Seedance؟
Seedance ليس النموذج الضعيف في هذه المقارنة. تسلط الصفحة الرسمية لـ ByteDance الضوء على مراجع الصور والصوت والفيديو بالإضافة إلى التحكم في الأداء والإضاءة وحركة الكاميرا. بالنسبة لمشروع تقليدي يريد إمكانات مستضافة مصقولة دون الحفاظ على البنية التحتية المحلية، يمكن أن يكون ذلك ميزة كبيرة.
كان لدى Huangguo مجموعة قيود مختلفة. احتاجت أكثر من مائة لقطة إلى أخذ عينات متكررة. كان لا بد من تعديل هوية الشخصية والحركة والحوار بشكل مستقل. كان يجب أن تكون التسديدة الفاشلة قابلة للاسترداد من أي مرحلة. يحتاج الاستوديو أيضًا إلى امتلاك أصول التدريب وقائمة انتظار الإنتاج الخاصة به. تنشر Wan 2.2 أوزان النماذج وكود الاستدلال، باستخدام مسارات T2V وI2V وTI2V وS2V التي يمكن دمجها في نظام عرض خاص.
| متطلبات الإنتاج | سير عمل Wan 2.2 المحلي | خدمة البذور العامة |
|---|---|---|
| الوصول إلى النموذج | الأوزان القابلة للتحميل ورمز الاستدلال | القدرة النهائية من خلال المنتجات المستضافة أو واجهات برمجة التطبيقات |
| الاستدلال المحلي | تعليمات التشغيل المحلية الرسمية | لا تقدم صفحة النموذج العامة أوزانًا أساسية قابلة للتنزيل |
| LoRA والتدريب المستهدف | يمكن الاتصال بأدوات LoRA/التدريب الكامل للمجتمع | لا يتم عرض مكدس التدريب على النموذج الأساسي من خلال الواجهة العامة |
| إنتاج دفعة | قوائم الانتظار المُدارة ذاتيًا، وذاكرة التخزين المؤقت، والجدولة متعددة العقد | تخضع لحصص API والتسعير وقواعد الخدمة |
| محتوى للبالغين | التنفيذ المحلي يظل المنتج مسؤولاً عن القانون والموافقة والسلامة | ينص Volcano Engine على أن نظام الأمان الخاص به يكتشف المخاطر الإباحية ويمنعها |
| أفضل ملاءمة | خط إنتاج خاص قابل للتدريب وقابل للعكس | إنشاء وسائط متعددة مريحة للعمل المتوافق مع السياسات |
يعد هذا قرارًا يتعلق بسير العمل، وليس تصنيفًا عالميًا لجودة الصورة. تقدم Seedance خدمة مُدارة قوية. احتاج Huangguo إلى ملكية الأوزان والبيانات ومنطق الجدولة. تقول صفحة إنشاء الأمان الخاصة بـ Volcano Engine أيضًا أن منصتها تتحكم بشكل واضح في المدخلات والمخرجات غير المتوافقة، مع اهتمام خاص بالمخاطر الإباحية، مما يستبعدها كمولد مركزي لهذه الحالة.
لماذا تقسم ثماني دقائق إلى لقطات 117؟
تضاعف الأجيال الأطول عدد الأشياء التي يمكن أن تنجرف: الوجوه، والأيدي، والملابس، وهندسة الخلفية، والاتصال بين الشخصيات، والإضاءة، وحركة الكاميرا. يمكن أن يتفاقم خطأ صغير في تفاعل معقد عبر ثوانٍ. اللقطات القصيرة لا تكون أسرع وتيرة تلقائيًا؛ يجعلون كل عرض قابلاً للاختبار.
يمكن تخصيص وظيفة واحدة للقطة مدتها من ثلاث إلى ثماني ثوانٍ: خط العين، أو الدوران، أو جملة واحدة، أو مرحلة حركة واحدة، أو تغيير الزاوية، أو إدراج التفاصيل. يمكن إعادة بناء المشاهد المعقدة من اللقطات الواسعة واللقطات المقربة والإدراجات وردود الفعل. يتم إنشاء الإحساس بالأداء المستمر في التحرير بدلاً من أن يكون مطلوبًا من جيل واحد.
يبدأ خط الإنتاج بلقطات قابلة للتنفيذ
1. تحويل البرنامج النصي إلى قاعدة بيانات الإنتاج
يمكن أن يساعد برنامج LLM في تنظيم الحبكة والعلاقات والحوار وترتيب المشهد. مسودة النثر الخاصة بها ليست مهمة عرض قابلة للاستخدام. تحتاج كل لقطة إلى معرف، ومجموعة، وإلقاء، وتأطير، وموضع الكاميرا، والحركة، والعاطفة، والحوار، والمدة، وحالة الافتتاح، وحالة النهاية، ومسار النموذج، وأي حركة أو مرجع صوتي مطلوب.
"شخصين يكملان تفاعلًا معقدًا في الغرفة" غامض جدًا. ويجب تقسيم المشهد إلى مدخل، واقتراب، ورد فعل، وتغيير موضع، وتفصيل، وحالة نهائية. وهذا يجعل حالات الفشل قابلة للتشخيص: فلم تعد التركيبة، والهوية، والحركة تنهار في نفس المشكلة.
2. مسار الدراما والحوار والحركة الصعبة بشكل منفصل
تصنف ملاحظات الإنتاج اللقطات على أنها سرد عادي، أو حوار، أو محتوى للبالغين، أو حركة معقدة، أو بيئة/انتقال، أو تشطيب/مؤثرات بصرية. تحصل كل فئة على نماذجها ومحولاتها ومعلمات أخذ العينات والمراجع واختبارات القبول الخاصة بها. يبدو الإعداد المسبق الشامل فعالاً حتى تؤدي عمليات إعادة المحاولة والإصلاحات إلى مسح الحفظ.
3. اجعل شخصية LoRA تجيب فقط "من هذا؟"
تحتاج الشخصيات الرئيسية إلى حزمة هوية نظيفة: الواجهة، والملف الشخصي، وعروض الثلاثة أرباع، والتعبيرات، وتغييرات الإضاءة، وعروض نصف الجسم وكامل الجسم، وحالات خزانة الملابس المتكررة. يجب أن يظل العمر وشكل الوجه والمكياج والنسب متسقة عبر البيانات؛ وإلا فإن المحول يتعلم متوسطًا غامضًا.
يتم تدريب الهوية والحركة المتخصصة بشكل منفصل. يحدد محول الشخصية من الموجود في الإطار. يصف محول المحتوى أو الحركة الأداء المطلوب. تتيح هذه النمطية للاستوديو استبدال الشخصية دون إعادة تدريب مجموعة الحركة بأكملها، أو تحسين الحركة دون تغيير وجه المؤدي.
أحد الفروق الفنية المهمة: الإصدار الرسمي لـ Wan يوفر الأوزان ورمز الاستدلال. يأتي تدريب LoRA بشكل عام من خلال أدوات مثل DiffSynth-Studio، والتي يدرجها المستودع الرسمي كتكامل مجتمعي يدعم LoRA والتدريب الكامل. إنه ليس زرًا مدمجًا في منتج Wan المستضاف.
4. قفل المجموعات المتكررة قبل العرض
تحتاج غرف النوم وغرف المعيشة والفنادق والممرات إلى حزم مرجعية خاصة بها. يجب تثبيت مواضع الأبواب والنوافذ، واتجاه الأثاث، والإضاءة الرئيسية، ودرجة حرارة اللون، ومواد الجدار، ومواضع الكاميرا القابلة للاستخدام. كلما زاد تفاعل الأداء مع الأسرة أو الأرائك أو الجدران، أصبح الانحراف المكاني أكثر وضوحًا. يعد قالب المجموعة بمثابة مرجع للاتجاه الفني ونظام إحداثي للتحكم في الوضع والعمق لاحقًا.
أنشئ الصورة الثابتة الصحيحة قبل أن تطلب منها التحرك
تبدأ اللقطات السردية المنتظمة كإطارات رئيسية معتمدة. لا يزال يحدد الهوية، والتعبير، وخزانة الملابس، والتكوين، والضوء، والموقع، ووضعية البداية. تعمل اللقطات الأكثر تعقيدًا أيضًا على حل عدد الأحرف والموضع النسبي واتجاه الجسم والانسداد والاتصال البيئي وزاوية الكاميرا وحدود الإطار قبل بدء إنشاء الفيديو.
يجب مراجعة كل إطار رئيسي يدويًا. تعد الوجوه، والعيون، والأيدي، ووصلات الأطراف، والنسب، وحواف الملابس، وملامسة الأثاث، والانعكاسات، ونص الخلفية، والكائنات الإضافية أرخص في الإصلاح مرة واحدة في الصورة المصدر مقارنة بالعشرات من إطارات الفيديو.
طبقات التحكم الثلاث للقطات المتخصصة
طبقة 1: يقوم الإطار الرئيسي بتأمين الهوية والوضعية والكاميرا
يقوم نموذج الصورة والمحولات المصممة لهذا الغرض بإنشاء إطار الفتح المعتمد. تجيب هذه الطبقة على الحاضرين وأين هم وكيف يتم تأطير المشهد. إنه يترك مساحة أقل لنموذج الفيديو لإعادة تصميم العلاقة بين الموضوعات.
طبقة 2: Wan 2.2 I2V/TI2V يعالج الوقت
يدخل الإطار المعتمد مسار Wan 2.2 I2V أو TI2V باستخدام المحولات المستهدفة أو الضبط الدقيق الذي تتطلبه تلك اللقطة. تتعامل هذه الطبقة مع استمرارية الحركة، والاحتفاظ بالهوية، واستمرارية الملمس، وحركة الكاميرا، والتوقيت. تقول الوثائق الرسمية لـ Wan أن TI2V-5B يدعم كلاً من تحويل النص إلى فيديو والصورة إلى فيديو في 720p و24fps، ويمكن تشغيله على وحدة معالجة رسومات المستهلك مثل RTX 4090.
طبقة 3: المراجع المرخصة تصف كيفية تحرك الإجراء
يمكن أن تشتمل الحركة الصعبة على فيديو مرجعي معتمد، أو تسلسلات وضعية هيكلية، أو معلومات عميقة. تعمل هذه المدخلات على تقييد المسار والسرعة وتحول الوزن والاتجاه والمسافة وحالة البداية/النهاية. تتحكم محولات الهوية في المؤدي؛ حركة مراقبة المراجع؛ القالب المحدد يقيد المساحة. يؤدي فصل هذه المسؤوليات إلى تقليل تبديل الشخصيات وتقاطعات الجسم والاتصال غير المستقر.
اللقطات العادية والحوار وإنهاء 24-to-30fps
بالنسبة للقطات العادية، فإن قابلية التحرير تتفوق على المشهد
أنشئ العديد من المرشحين، ثم تحقق من الهوية، والامتثال للوحة القصة، وخط العين، واستمرارية خزانة الملابس، وتعيين الاستمرارية، وما إذا كان من الممكن قطع الإطارات السيئة بشكل نظيف. تعد اللقطة المقيدة التي تستمر من الإطار الأول إلى الأخير أكثر قيمة من حركة الكاميرا الطموحة التي تتغير في منتصف الصورة.
الحوار: Wan-S2V أو تمريرة منفصلة لمزامنة الشفاه
يصف مشروع Wan-S2V الرسمي نموذجًا يحول صورة واحدة بالإضافة إلى الصوت إلى فيديو متزامن مع التعبيرات الطبيعية وحركة الجسم وسلوك الكاميرا السينمائي. لا تزال لقطة الحوار المفيدة تتضمن أكثر من مجرد أشكال الفم. التنفس قبل الكلام، والتوقف المؤقت، وحركة العين، والوضعية، ورد الفعل بعد السطر، يجعل الأداء قابلاً للتصديق. عندما لا يكون S2V هو المسار الصحيح، يمكن للفريق إنشاء اللقطة المرئية أولاً وتطبيق مزامنة الشفاه في النشر.
24fps إلى 30fps: الإطارات المكررة ليست استيفاءً
تشير ملاحظات الإنتاج إلى أن مقاطع مصدر Wan تم إنشاؤها بسرعة 24fps وتتوافق مع 30fps الرئيسي. يضيف تحويل التكرار الأساسي ستة إطارات إخراج في الثانية، أو إطارًا واحدًا متكررًا في كل خمسة إطارات إخراج. بدلاً من ذلك، يؤدي التدفق البصري أو الاستيفاء بالذكاء الاصطناعي إلى إنشاء إطارات اصطناعية بين الإطارات ولها نمط مختلف من القطع الأثرية.
تحتاج كلتا الطريقتين إلى مراجعة على مستوى اللقطة. يمكن أن تنتج الأيدي والشعر والأشكال المتداخلة والحركة السريعة أخطاء هيكلية جديدة بين إطارات المصدر القابلة للاستخدام. يتضمن التشطيب أيضًا رفع المستوى، وإزالة الوميض، وتقليل الضوضاء، ومطابقة الألوان، وتصحيح التعريض، وإعادة الطلاء المحلي، وإزالة الإطار السيئ، وتثبيت الضوء.
يقوم الصوت والتحرير بتحويل مقاطع 117 إلى فيلم واحد
إن إكمال إنشاء الفيديو يعني فقط وجود المادة الخام. إن حوار TTS، والأجواء، وصوت الحركة، والموسيقى، والانتقالات، والمزج، وتقليل الضوضاء، وتطبيع جهارة الصوت يخلق استمرارية سمعية. تحمل الترجمات المصاحبة ورسومات المراسلة وواجهات النظام والعناوين والمؤثرات البصرية المقيدة العبوة السردية.
يجب أن يحافظ التعديل النهائي على اتجاه الشاشة، وخطوط العين، وخزانة الملابس، وضبط الإضاءة، والحركة عند القطع، ومزامنة الشفاه، وتوقيت الصوت أثناء إزالة كل إطار فاشل. أنتجت منظمة العفو الدولية قطعًا منفصلة من 117. جعلهم التحرير يشعرون وكأنهم فيلم قصير مدته ثماني دقائق.
ما هي الأجهزة التي يتطلبها سير العمل هذا؟
24GB VRAM: كافية للتحقق من الصحة، وليس بالضرورة للتنفيذ على نطاق واسع
يمكن تشغيل أمر TI2V-5B الرسمي الخاص بـ Wan مع 24GB من VRAM على الأقل باستخدام إلغاء تحميل النموذج وتحويل dtype ووضع وحدة المعالجة المركزية لـ T5. يعد ذلك مفيدًا لاختبارات الشخصية والتطوير السريع والإطارات الرئيسية والمقاطع المحدودة. يمثل تسليم لقطة 117 مشكلة في الإنتاجية: كل لقطة معتمدة قد تتخلف عن عدة محاولات مرفوضة.
وحدة معالجة الرسومات المزدوجة أو العقد المتعددة: قوائم الانتظار المتوازية هي الأكثر أهمية
تسرد NVIDIA 96GB من ذاكرة GDDR7 ECC والحد الأقصى لطاقة اللوحة 600W لـ RTX PRO 6000 Blackwell Workstation Edition. وبالتالي تمثل البطاقتان 192GB إجمالي VRAM و1,200W من الحد الأقصى لطاقة اللوحة؛ الأربعة تمثل 384GB و2,400W قبل وحدة المعالجة المركزية والتخزين والذاكرة والتبريد.
لا تعد ذاكرة VRAM المجمعة مجموعة ذاكرة مشتركة واحدة تلقائيًا. لا تعمل بطاقتا 96GB بطبيعتهما مثل بطاقة 192GB واحدة. يجب أن يستخدم البرنامج توازي البيانات، أو توازي النماذج، أو مهام العرض المنفصلة لتحقيق الاستفادة. بالنسبة للقطات 117، غالبًا ما يكون توزيع الوظائف المستقلة عبر عدة عقد أكثر مرونة من بناء محطة عمل متطرفة واحدة.
قائمة التحقق من الجودة والحقوق على مستوى اللقطة
- يتم تعريف كل شخصية مصورة بشكل واضح وتقديمها كشخص بالغ.
- لقد وثقت الوجوه والأصوات ومراجع الحركة وبيانات التدريب التفويض والمصدر.
- لا يظهر أي شخص حقيقي في المحتوى الحميم العميق غير التوافقي.
- تتوافق الهوية والوجه وبنية الجسم مع تصميم الشخصية المعتمد.
- لا توجد أطراف مندمجة، أو تقاطعات، أو تشريح غير مبرر، أو حركة غير متماسكة جسديًا.
- تستمر خزانة الملابس وهندسة المجموعة والإضاءة واتجاه الشاشة عبر اللقطات المجاورة.
- تتم إزالة الوميض وفشل النسيج والنص الزائف والإطارات المحرفة المدمرة.
- تتم مزامنة الحوار وأداء الوجه وصوت الحركة.
- يفي معدل الإطارات والدقة واللون والجهارة بالمواصفات الرئيسية.
- يتبع الإخراج القانون وقواعد النظام الأساسي في كل من مواقع الإنتاج والتوزيع.
الأسئلة المتداولة
لماذا يعتبر Wan 2.2 مناسبًا بشكل أفضل لهذا الفيلم القصير المخصص للبالغين والمخصص للذكاء الاصطناعي؟
إنه ليس أفضل تلقائيًا لكل فيلم. احتاج Huangguo إلى أوزان قابلة للتنزيل، واستدلال محلي، وأدوات تدريب خارجية، وقوائم انتظار مُدارة ذاتيًا. بالنسبة للمحتوى التقليدي المتوافق مع السياسة، قد يكون سير العمل متعدد الوسائط المستضاف في Seedance أكثر بساطة.
لماذا لا تستخدم سيدانس؟
يتم تقديم Seedance علنًا كخدمة توليد مستضافة، ويوثق Volcano Engine فحوصات السلامة التي تتضمن مخاطر إباحية. كما أن واجهته العامة لا تعرض حزمة تدريب النموذج الأساسي للمستخدمين النهائيين. وهذا يجعله غير متوافق مع هذا النوع من المحتوى الخاص بالبالغين، دون التقليل من نقاط قوته في صناعة الأفلام العادية.
هل يمكن إنتاج فيلم AI مدته ثماني دقائق في تمريرة واحدة؟
أصبح سير العمل القائم على اللقطة أسهل حاليًا في التحكم والإصلاح. استخدم Huangguo لقطات 117 لمراجعة اللقطات بشكل مستقل، ثم اعتمد على التحرير والصوت لبناء الاستمرارية.
هل لا يزال الانتشار المستقر أو التدفق مهمًا؟
نعم. تظل نماذج الصور مفيدة لتحويل الأحرف وتعيين المراجع والإطارات الرئيسية. تتعامل نماذج الفيديو ومرحلة ما بعد الإنتاج مع الحركة والحوار والاستمرارية الزمنية.
هل يجب دمج LoRAs الخاصة بالشخصية والمحتوى؟
عادة لا. إن فصل الهوية عن الحركة أو القدرة على المحتوى يجعل الاستبدال وإعادة التدريب وتصحيح الأخطاء أسهل. لا يزال التصميم النهائي يعتمد على حجم مجموعة البيانات وطريقة التدريب.
هل يستطيع الحاسوب الشخصي فعل ذلك؟
يمكن أن يبدأ بـ TI2V-5B على وحدة معالجة الرسومات 24GB. ومع ذلك، فإن "يمكن عرض مقطع" و"يمكن تقديم لقطات معتمدة من 117 في الموعد المحدد" هما عتبتان مختلفتان. أصبح التخزين وإعادة المحاولة وإدارة قائمة الانتظار والمراجعة البشرية على نفس القدر من الأهمية.
العائق الحقيقي هو خط الإنتاج الخاص
يمكن تلخيص طريقة Huangguo على النحو التالي: هيكلة القصة كلقطات قابلة للتنفيذ؛ قفل الهوية باستخدام محولات الأحرف؛ الحفاظ على المساحة باستخدام قوالب محددة؛ الموافقة على الإطارات الرئيسية؛ تحريك المقاطع القصيرة باستخدام Wan 2.2 والمتغيرات المستهدفة؛ توجيه الحركة الصعبة بمراجع مرخصة؛ توجيه الحوار من خلال S2V أو مزامنة الشفاه؛ ثم قم بإنهاء الصوت واللون والاستيفاء والتحرير على مخطط زمني 30fps.
يمثل Seedance إنشاء مقاطع فيديو مستضافة قوية. يوفر Wan 2.2 الأوزان ورمز الاستدلال ومساحة أكبر لتعديل النظام. بالنسبة لهذا المشروع القانوني والمصرح به - مع تركيزه على الخصوصية والإنتاج المتكرر للدفعات - كان هذا الاختلاف حاسمًا. تهدف المقارنة إلى مساعدة القراء على تحديد المسار الذي يتوافق مع المحتوى الخاص بهم، والميزانية، والمهارات الفنية، والتزامات الامتثال، وليس تسليم "أفضل نموذج" عالمي واحد.