N NSFWAITool
العربية

اختبار MiniMax H3 NSFW: EasyCache مقابل Spectrum، Plus Wan-Animate-2 مقابل SCAIL-2

اختبار تسريع MiniMax H3 واختبار الرسوم المتحركة للشخصية مقارنة EasyCache وSpectrum وWan-Animate-2 وSCAIL-2

لقد انتهيت بالأمس من اختبار إعداد تسريع MiniMax H3. اليوم هبطت واحدة أخرى.

بالطبع فعلت.

هذا هو ComfyUI في 2026: المعيار الخاص بك بالكاد يكون باردًا قبل أن يطلق شخص ما عقدة جديدة ويجعل الأمر برمته يبدو قديمًا. كان إعداد الأمس هو EasyCache بالإضافة إلى SageAttention. إضافات اليوم كانت Spectrum ومكون إضافي للسرعة يتم تداوله في مجتمع ComfyUI الصيني. في نفس الوقت تقريبًا، أصبحت Wan-Animate-2 أخيرًا مفتوحة المصدر، مما أعطاني عذرًا آخر لمقارنتها مع SCAIL-2.

لذلك تحول هذا إلى ثلاثة اختبارات بدلاً من اختبار واحد:

  • EasyCache + SageAttention مقابل Spectrum على MiniMax H3؛
  • مخرجات H3 العادية مقابل الضبط الدقيق لـ NSFW الذي صنعه المجتمع؛
  • Wan-Animate-2 مقابل SCAIL-2 للرسوم المتحركة للشخصية.

النسخة القصيرة: فاز EasyCache في اختبار التوقيت بفارق ميل، وأثبت مقطع NSFW المنشور أنه أقل من المطالبات الفورية، كما أن عينتي الرسوم المتحركة للشخصيتين لم يتم التحكم بهما بدرجة كافية لتتويج الفائز. النسخة الأطول هي أكثر إثارة للاهتمام.

ملاحظة المحرر: هذا تعديل باللغة الإنجليزية الأصلية للملاحظات العملية التي نشرتها في الأصل 赵KK搞AI على WeChat، وليس ترجمة سطرًا بسطر. يتم الاحتفاظ بنتائج وآراء اختبار الشخص الأول من المؤلف الأصلي؛ تم فحص السياق الفني والمحاذير مقابل مستودعات المشروع الرسمية.

أولاً، اختبار السرعة: ثانية 692 مقابل ثانية 1,590

قام كلا تشغيلي MiniMax H3 بإنشاء مقطع عمودي 15 ثانية عند 544 × 960. تم الانتهاء من سير عمل EasyCache + SageAttention 692.69 ثانية، أو حول 11 دقيقة 33 ثانية. استغرق الطيف 1,590.15 ثانية، أو حول 26 دقيقة 30 ثانية.

وهذا يجعل EasyCache + SageAttention تقريبًا 2.3× أسرع في هذا السباق. لقد أدى إلى تقليل وقت الانتظار بما يزيد قليلاً عن 56%.

إعداد ميني ماكس H3 الإخراج الوقت المقاس نتيجة نسبية
EasyCache + SageAttention 15s، 544 × 960 692.69s 1.0×
نطاق 15s، 544 × 960 1,590.15s 2.3× أطول

واجهة ComfyUI باللغة الإنجليزية تكمل تشغيل MiniMax H3 EasyCache وSageAttention في ثواني 692.69

يتم تشغيل EasyCache + SageAttention كما هو مسجل في ComfyUI. مصدر الصورة: 赵KK搞AI.

سجل مهام ComfyUI باللغة الإنجليزية يعرض ثواني 1,590.15 لـ Spectrum و692.69 ثواني لـ EasyCache بالإضافة إلى SageAttention

أوقات المهمة المسجلة. هذه هي لقطة الشاشة المفيدة؛ إنه ينقذنا من التظاهر بأن "الشعور بشكل أسرع" هو المعيار. مصدر الصورة: 赵KK搞AI.

خرج 15-الثاني MiniMax H3 المرفق باختبار التسارع. مصدر الفيديو: 赵KK搞AI.

قبل أن يحول أي شخص رقم 2.3× هذا إلى قانون عالمي: لا تفعل ذلك. لا توفر المقالة ورقة إمكانية تكرار نتائج كاملة مع نموذج GPU وإصدارات البرامج والبذور ومعلمات أخذ العينات وإعدادات كل عقدة. هذه إحدى نتائج سير العمل الحقيقية، وليست لوحة صدارة للسرعة تمت مراجعتها من قبل النظراء.

ومع ذلك، فإن الفارق بهذا الحجم ليس لا شيء. إذا كان سؤالي الوحيد هو "ما هو الإعداد الذي يتيح لي الحصول على مسودة أخرى عاجلاً على هذا الجهاز؟"، فسيكون EasyCache + SageAttention هو الخيار الأول الواضح.

لماذا كان EasyCache أسرع هنا

المسرعان لا يقومان بنفس الحيلة.

EasyCache هو النهج الأكثر عدوانية. باللغة الإنجليزية البسيطة، يحاول إعادة استخدام العمل من خطوات تقليل الضوضاء السابقة بدلاً من تشغيل الحساب الكامل مرة أخرى في كل مرة. عندما يظل الجيل مستقرًا، يمكن أن يوفر ذلك الكثير من الحوسبة. من السهل أيضًا فهم الخطر: إذا بدأ التقدير المخزن مؤقتًا في الانحراف، فقد يتراكم الخطأ.

نطاق هو أكثر تحفظا. يستخدم تنفيذ ComfyUI الخاص به التنبؤ بالميزات - تنبؤ Chebyshev وانحدار التلال - للتنبؤ بميزات المحولات المتوسطة، ثم يسمح للنموذج بمواصلة تحسين النتيجة. إنه أقل شبهاً بنسخ التمريرة السابقة وأكثر أشبه برسم المسار التالي من المسار الأخير قبل أن يقوم النموذج بتنظيفه.

وهذا يجعل Spectrum مثيرًا للاهتمام من الناحية الفنية. لم يجعلها سريعة في هذا الاختبار بالذات.

ما يتغير EasyCache + SageAttention نطاق
الفكرة الأساسية إعادة استخدام الحساب السابق وتقليل تكلفة الاهتمام توقعات الميزات المتوسطة من التاريخ الحديث
من أين يأتي المكسب تخطي المزيد من العمل المتكرر تجنب بعض حسابات المحولات
المقايضة المحتملة المزيد من الفرص للانجراف المتراكم تسارع أكثر تحفظا
النتيجة في هذا الاختبار 692.69s 1,590.15s

ما هو مفقود هو A/B مرئي مناسب: نفس البذرة، نفس المصدر، نفس الموجه، نفس إعدادات أخذ العينات، كلا المخرجين متاحان بجودة كاملة. بدون ذلك، أستطيع أن أخبرك أي جولة انتهت أولاً. لا أستطيع أن أخبرك بصراحة الطريقة التي احتفظت بمزيد من التفاصيل.

هذا التمييز مهم. إنها أيضًا الطريقة التي نحاول بها فصل مطالبة مقدم الخدمة عن النتيجة التي يمكن ملاحظتها في منهجية مراجعة NSFWAITol. يمكن لساعة الإيقاف أن تثبت السرعة. لا يمكنها إثبات جودة الصورة بنفسها.

يحتاج "نموذج NSFW MiniMax H3" إلى علامة النجمة

نسخة NSFW التي تمت مناقشتها هنا كانت ليس إصدار MiniMax رسميًا. ال مستودع MiniMax H3 الرسمي يصف نموذج متعدد الوسائط للأغراض العامة. جاء التصميم الموجه للبالغين من مجتمع مستقل تم اختباره لخمسة إصدارات.

اختفى الرابط بسرعة وكان يعرض بالفعل 404 عند تحديده. وهذا أمر مزعج، ولكنه طبيعي أيضًا في هذا الركن من الذكاء الاصطناعي مفتوح المصدر: يمكن إصدار النموذج أو نسخه أو إعادة تسميته أو حذفه قبل أن ينتهي معظم الأشخاص من تنزيله. إذا كان سير عمل الإنتاج يعتمد على بقاء مستودع مجتمعي واحد لم يتم التحقق منه متصلاً بالإنترنت إلى الأبد، فإن سير العمل ليس موجودًا بالفعل بعد.

استخدم الاختبار الأصلي موجهًا طويلًا ومتعدد الكاميرات لخط الأساس. تضمنت بكرة عمودية 15 ثانية وعدسات وزوايا متعددة وتصميمًا متسقًا وموسيقى وإضاءة وهوية عبر القطع. نتيجة H3 العادية أدناه.

إخراج الأزياء Baseline MiniMax H3. تعد علامة "V" المرئية جزءًا من المقطع المصدر وقد تم الاحتفاظ بها. مصدر الفيديو: 赵KK搞AI.

بالنسبة لاختبار البالغين، احتفظ الموجه بنفس بنية الكاميرات المتعددة ولكنه غير تقدم خزانة الملابس إلى تسلسل واضح لخلع الملابس. وهذه طريقة معقولة لاختبار الضبط الدقيق: حافظ على تصميم اللقطة وقم بتغيير السلوك الذي تريد قياسه بالفعل.

هذه هي النتيجة العامة المضمنة في المقالة الأصلية:

تم نشر إعلان تشويقي لمجتمع NSFW Fine-Tune. تم استبدال التسميات التوضيحية الصينية الأصلية بترجمات باللغة الإنجليزية؛ تظل العلامة "V" جزءًا من الفيديو المصدر. مصدر الفيديو: 赵KK搞AI.

وهنا يجب أن أفسد التسويق قليلاً: لا يُظهر المقطع العام تسلسل التعري الكامل الموصوف في الموجه. يبقى ملبوسًا وينتهي بخط مثير يصل إلى "إذا كنت تريد رؤيته حقًا، جربه بنفسك". مضحك؟ نعم. دليل على السلوك الكامل غير الخاضع للرقابة؟ لا.

لذلك أود أن أتعامل مع هذا كدليل على وجود ضبط دقيق لمجتمع NSFW H3 ويمكن أن ينتج إعلانًا تشويقيًا متماسكًا تحت عنوان البالغين. لن أستخدم المقطع العام كدليل على أنه أكمل كل التعليمات الصريحة. هذان ادعاءان مختلفان، والجمع بينهما هو الطريقة التي تتحول بها عروض الذكاء الاصطناعي التجريبية إلى هراء.

إذا كنت تقارن بين خيارات مقاطع الفيديو للبالغين المستضافة والمحلية، فكلما كان الأمر أوسع دليل مولد الفيديو الإباحية AI هي نقطة بداية أفضل من المراهنة بكل شيء على مستودع محذوف.

أصبح Wan-Animate-2 مفتوح المصدر، لذا نعم، لقد قمت باختباره أيضًا

وان-تحريك-2 أصدرت كود الاستدلال وأوزان النموذج في أغسطس 2026. يحرك المشروع شخصية مرجعية مباشرةً من الفيديو المصدر مع محاولة الحفاظ على الهوية والحركة والتعبير وسلوك الكاميرا. إنه نظام شامل، لذا فهو لا يحتاج إلى مستخرج وضعي منفصل يجلس في منتصف خط الأنابيب.

نظرة عامة باللغة الإنجليزية على خط أنابيب الرسوم المتحركة للشخصية Wan-Animate-2 من طرف إلى طرف

نظرة عامة على خط أنابيب Wan-Animate-2 مضمنة في المقالة الأصلية. مصدر الصورة: 赵KK搞AI؛ التفاصيل الفنية: مشروع Wan-Animate-2.

انعطاف سريع، لأنه من الواضح أن هذا لا يزال بحاجة إلى القول: Wan 3.0 ليس مفتوح المصدر. وهذا أمر مخيب للآمال. لا يجعل الإساءة مجهولة المصدر تستهدف المطورين أذكياء أو مبدئيين. أنت تستخدم نماذج قضى أشخاص آخرون أشهرًا في بنائها، ثم تتصرف كخيانة شخصية لأنهم لم يسلموك النموذج التالي وفقًا لجدولك الزمني المفضل. إذا كان بإمكانك بناء Wan 4.0 بنفسك، فيرجى القيام بذلك. سأكون الأول في الصف لأطلب منك رفع الأثقال.

كون Wan-Animate-2 مفتوح المصدر لا يسوي بطريقة سحرية وسيطة Wan 3.0، لكنه لا يزال إصدارًا ذا معنى. يظل نظام Wan البيئي أحد الأماكن القليلة التي يمكن للأشخاص فيها فحص النموذج وتعديله وتوصيله إلى خط أنابيب ComfyUI خاص. وهذا مهم أكثر بالنسبة لمشاريع البالغين، حيث قد لا تسمح المنتجات المستضافة بالمادة على الإطلاق. لدينا أطول Wan 2.2 سير عمل الأفلام القصيرة للبالغين يشرح لماذا تصبح السيطرة المحلية أحد متطلبات الإنتاج بمجرد أن ينمو المشروع إلى ما هو أبعد من بضعة مقاطع.

يحتوي إعداد Wan-Animate-2 على خطوة واحدة يمكن تفويتها بسهولة

قبل تشغيل الرسوم المتحركة، يجب وصف الصورة المرجعية باستخدام LLM. يوصي المشروع الرسمي بوصف موضوعي لمظهر الشخصية وخلفيتها مع استبعاد الأفعال والأحكام الذاتية والتكهنات العاطفية.

في اللغة الإنجليزية الطبيعية، التعليمات هي في الأساس:

صف فقط ما هو موجود بشكل واضح في الصورة المرجعية. قم بتغطية مظهر الموضوع وملابسه وشعره وإكسسواراته وخلفيته. لا تصف الإجراءات. لا تخمن الشخصية أو المزاج أو النية.

يبدو هذا صعبًا حتى ترى سبب مساعدته. يوفر فيديو القيادة الإجراء بالفعل. إذا كان الوصف النصي يبتكر إجراءً آخر، فقد أعطيت النموذج مخرجين يصرخان بتعليمات مختلفة.

يتم تشغيل سير عمل Wan-Animate-2 داخل واجهة ComfyUI باللغة الإنجليزية

Wan-Animate-2 في ComfyUI. مصدر الصورة: 赵KK搞AI.

الإعداد الآخر الذي يخطئ الناس فيه هو طول الإطار. في 24 fps، تكون الحسابات بسيطة:

المدة بالثواني × 24 = عدد الإطارات المستهدفة

يستخدم سير العمل الموضح في المصدر قطع إطار 81، لذا تتطلب المقاطع الأطول عدة تمريرات.

المدة المستهدفة الإطارات بمعدل 24 إطارًا في الثانية هناك حاجة إلى قطع إطار 81
3 ثانية 72 1
5 ثانية 120 2
8 ثانية 192 3
10 ثانية 240 3
15 ثانية 360 5
30 ثانية 720 9

عقدة Wan-Animate-2 ComfyUI مع طول الإطار المعين على 81

إعداد طول الإطار 81 المستخدم في سير العمل. مصدر الصورة: 赵KK搞AI.

تم ضبط إعداد 720p الافتراضي للمستودع الرسمي على ثماني وحدات معالجة رسوميات A800، مع تكوين 480p الذي تم اختباره على وحدتي A800. هذا ليس متطلبًا صغيرًا ودودًا "انقر فوق Queue Prompt على جهاز الكمبيوتر المحمول الخاص بي". ستستمر تحسينات المجتمع في دفع أرضية الذاكرة إلى الأسفل، ولكن من الواضح أن أي شخص يكتب عن هذا كما لو كانت الرسوم المتحركة للشخصيات المحلية مجانية لم يشاهد أبدًا شريط تقدم يزحف عبر سير عمل حقيقي.

Wan-Animate-2 مقابل SCAIL-2: المقاطع لا تثبت الفائز

ال SCAIL-2 يأخذ المشروع طريقًا مشابهًا من البداية إلى النهاية. إنه يتجنب تمثيل الوضع المتوسط ​​ويضيف دلالات القناع بالإضافة إلى تكييف متعدد المرجع. يدعم إصداره الرسمي سير عمل 512p و704p، مع توصية المشروع بالمتغير القائم على الوضعية في 704p.

إليك نموذج Wan-Animate-2 المحفوظ من المقالة الأصلية:

عينة Wan-Animate-2. يقوم الملف المصدر بتبديل عرض القيادة/المرجع والحرف الذي تم إنشاؤه بسرعة؛ يتم استنساخه هنا دون تغيير. مصدر الفيديو: 赵KK搞AI.

وهنا نموذج SCAIL-2:

نموذج الرسوم المتحركة لشخصية SCAIL-2. مصدر الفيديو: 赵KK搞AI.

لن أعلن عن الفائز من هذين المقطعين، لأن ذلك سيكون دقة زائفة. يستخدمون شخصيات مختلفة ومصادر حركة مختلفة وإطارات مختلفة ومدد مختلفة. لا يستغرق تحميل Wan-Animate-2 سوى حوالي 2.7 من الثواني ويتبادل طرق العرض بسرعة كبيرة بحيث يصعب الحكم على العيوب الزمنية. يتم تشغيل مقطع SCAIL-2 لمدة تسع ثوانٍ تقريبًا وهو أسهل بكثير في الفحص، ولكن "الفحص الأسهل" ليس هو نفس الشيء مثل "النموذج الأفضل".

تحتاج المقارنة الحقيقية إلى نفس الصورة المرجعية، وفيديو القيادة، والدقة، وعدد الإطارات، والأجهزة، وسياسة البذور، والمعالجة اللاحقة. ثم سأسجل الاحتفاظ بالهوية، وثبات اليد، واستعادة الإطباق، وتعبيرات الوجه، وحركة القماش، وتسرب الخلفية، وإجمالي وقت العرض. أي شيء أقل من ذلك هو مقارنة بكرة تجريبية.

ما سأستخدمه بالفعل بعد هذه الاختبارات

بالنسبة لسرعة التكرار MiniMax H3، سأبدأ بها EasyCache + SageAttention. الفجوة في هذا المدى كبيرة جدًا بحيث لا يمكن تجاهلها. سأستمر في تقديم عدد قليل من العينات المطابقة قبل قبول مقايضة الجودة، لأن السرعة التي تلحق الضرر بالوجوه أو الحركة بهدوء ليست سرعة، بل هي مجرد توليد عمليات مرفوضة بشكل أسرع.

أود أن أعامل نطاق باعتباره البديل المثير للاهتمام والأكثر تحفظًا، وليس الفائز في جولة التوقيت هذه. إنه يستحق اختبار الجودة الخاضع للرقابة، خاصة إذا بدأ EasyCache في تجميع الأخطاء المرئية في لقطة أطول أو أكثر صعوبة.

ل المجتمع NSFW H3 صقل، سأنتظر مستودعًا مستقرًا وبطاقة نموذجية وسجل الإصدار وعينات قابلة للتكرار. يكفي الرابط المختفي والإعلان التشويقي الخجول لإثارة فضولي. إنها ليست كافية لبناء سير عمل إنتاجي.

ل Wan-Animate-2 مقابل SCAIL-2، سأقوم بتشغيل المدخلات المطابقة الخاصة بي. كلا المشروعين مفتوحان بما يكفي ليستحقا اختبارًا جديًا. العينات الموجودة في المقالة الأصلية ببساطة لا تجيب على السؤال.

قد يبدو هذا أقل إثارة من مقولة "النموذج (أ) يدمر النموذج (ب)،" لكنه أكثر فائدة بكثير. يوجد بالفعل ما يكفي من اليقين الزائف في قياس الذكاء الاصطناعي. لا نحتاج إلى صناعة فائز آخر من مقطعي فيديو غير مرتبطين.

الأسئلة المتداولة

هل MiniMax H3 هو نموذج NSFW رسميًا؟

رقم MiniMax H3 هو نموذج متعدد الوسائط للأغراض العامة. كان إصدار NSFW الذي تمت مناقشته هنا عبارة عن تحسين مجتمعي مستقل، وليس إصدارًا رسميًا لـ MiniMax.

هل EasyCache دائمًا أسرع من Spectrum على MiniMax H3؟

لم يثبت. كان EasyCache + SageAttention أسرع بحوالي 2.3× في اختبار 15 المحدد بالثانية، 544 × 960. قد تؤدي الأجهزة والبذور وإصدارات العقد وإعدادات الجودة المختلفة إلى تغيير النتيجة.

هل أكمل العرض التوضيحي العام لـ NSFW المطالبة الصريحة الكاملة؟

المقطع المنشور لا يظهر ذلك. يظل يرتدي ملابسه وينتهي كإعلان تشويقي، لذا لا يمكنه التحقق من تسلسل خلع الملابس الكامل الموصوف في الموجه.

هل Wan-Animate-2 أفضل من SCAIL-2؟

مقطعي المصدر ليسا مقارنة مضبوطة. إنهم يستخدمون مدخلات وأطوالًا مختلفة، لذا فهم يوضحون أن كلا سير العمل يعمل، وليس أيهما أفضل.

لماذا يستخدم سير عمل Wan-Animate-2 إطارات 81؟

هذا هو طول القطعة المستخدمة في سير عمل ComfyUI الموضح. عند 24 إطارًا في الثانية، يتم تقسيم الأهداف الأطول عبر مجموعات إطار 81 المتعددة ثم يتم تجميعها.

ما مقدار أجهزة GPU التي يحتاجها Wan-Animate-2؟

يوثق المشروع الرسمي إعداد 720p الافتراضي على ثماني وحدات معالجة رسومات A800 وإعداد 480p الذي تم اختباره على اثنتين من وحدات A800. قد تؤدي عقد المجتمع والتفريغ إلى تقليل المتطلبات، وعادةً ما يكون ذلك على حساب السرعة.

هل يمكن استخدام هذه النماذج لمحتوى للبالغين؟

لا يؤدي التوفر المحلي إلى إزالة المتطلبات القانونية أو متطلبات الموافقة. استخدم فقط شخصيات البالغين بشكل واضح والصور المرجعية والأصوات ولقطات القيادة المرخصة بشكل صحيح. لا تقم بإنشاء صور مزيفة حميمة لأشخاص حقيقيين دون موافقة.