N NSFWAITool
Deutsch

MiniMax H3 im NSFW-Test: EasyCache vs. Spectrum sowie Wan-Animate-2 vs. SCAIL-2

Test zur Beschleunigung und Figurenanimation mit MiniMax H3, EasyCache, Spectrum, Wan-Animate-2 und SCAIL-2

Gestern habe ich einen MiniMax H3 Beschleunigungs-Setup getestet. Heute ist ein anderer gelandet.

Natürlich hat es das getan.

Das ist ComfyUI im Jahr 2026: Ihr Benchmark ist kaum kalt, bevor jemand einen neuen Knoten veröffentlicht und das Ganze sich veraltet anfühlt. Gestern wurde EasyCache plus SageAttention eingerichtet. Die heutigen Ergänzungen waren Spectrum und ein weiteres Speed-Plugin, das in der chinesischen ComfyUI-Community zirkuliert. Ungefähr zur gleichen Zeit wurde Wan-Animate-2 schließlich Open Source, was mir eine weitere Entschuldigung gab, es mit SCAIL-2 zu vergleichen.

Dies führte zu drei statt zu einem Test:

  • EasyCache + SageAttention versus Spectrum auf MiniMax H3;
  • die reguläre H3-Ausgabe im Vergleich zu einer von der Gemeinschaft entwickelten NSFW-Feinsteuerung;
  • Wan-Animate-2 gegen SCAIL-2 für Charakteranimation.

Die kurze Version: EasyCache gewann den Timing-Test um eine Meile, der veröffentlichte NSFW-Clip beweist weniger als die prompten Behauptungen, und die beiden Charakter-Animations-Samples sind nicht annähernd kontrolliert genug, um einen Gewinner zu krönen. Die längere Version ist interessanter.

Anmerkung des Herausgebers: Dies ist eine native-englische Adaption von Hands-on-Notizen, die ursprünglich von KK搞AI auf WeChatKeine zeilenweise Übersetzung. First-Person-Testergebnisse und Meinungen werden vom ursprünglichen Autor beibehalten; der technische Kontext und die Vorbehalte wurden mit den offiziellen Projekt-Repositories verglichen.

Erstens der Geschwindigkeitstest: 692 Sekunden gegenüber 1.590 Sekunden

Beide MiniMax H3-Läufe erzeugten einen 15-sekündigen vertikalen Clip bei 544 × 960. Der EasyCache + SageAttention Workflow wurde abgeschlossen 692,69 Sekundenoder über 11 Minuten 33 Sekunden. Frequenzabnahme 1.590,15 Sekundenoder über 26 Minuten 30 Sekunden.

Das macht EasyCache + SageAttention ungefähr so 2,3x schneller in diesem Lauf. Es verkürzte die Wartezeit um etwas mehr als 56%.

MiniMax H3 Setup Output Gemessene Zeit Relatives Ergebnis
EasyCache + SageAttention 15s, 544 × 960 692.69s 1,0 x
Spektrum 15s, 544 × 960 1.590.15s 2,3 x länger

Englisches ComfyUI-Interface, das MiniMax H3 EasyCache und SageAttention in 692,69 Sekunden abschließt

Der EasyCache + SageAttention läuft wie in ComfyUI aufgezeichnet. Quelle: 赵KK搞AI.

Englisch ComfyUI Task History mit 1.590,15 Sekunden für Spectrum und 692,69 Sekunden für EasyCache plus SageAttention

Die beiden aufgezeichneten Aufgabenzeiten. Dies ist der nützliche Screenshot; es erspart uns vorzugeben, dass "schneller gefühlt" ein Benchmark ist. Quelle: 赵KK搞AI.

Der 15-sekündige MiniMax H3-Ausgang, der an den Beschleunigungstest angeschlossen ist. Quelle: 赵KK搞AI.

Bevor jemand diese 2,3-fache Zahl in ein universelles Gesetz verwandelt: nicht. Die Ware enthält kein vollständiges Datenblatt zur Reproduzierbarkeit mit GPU-Modell, Softwareversionen, Seeds, Probenahmeparametern und Einstellungen pro Knoten. Dies ist ein echtes Workflow-Ergebnis, keine Peer-Review-Speed-Chancenliste.

Dennoch ist ein Unterschied so groß nicht nichts. Wenn meine einzige Frage lautete: "Welches Setup bringt mir einen anderen Entwurf früher auf diesem Computer?", Wäre EasyCache + SageAttention die offensichtliche erste Wahl.

Warum EasyCache hier schneller war

Die beiden Beschleuniger machen nicht den gleichen Trick.

EasyCache ist der aggressivere Ansatz. Im Klartext versucht es, Arbeiten aus früheren Entrauschungsschritten wiederzuverwenden, anstatt die vollständige Berechnung jedes Mal erneut auszuführen. Wenn die Generation stabil bleibt, kann das viel Rechenaufwand sparen. Das Risiko ist ebenso leicht zu verstehen: Wenn die zwischengespeicherte Schätzung zu driften beginnt, kann sich der Fehler ansammeln.

Spektrum ist zurückhaltender. Die ComfyUI-Implementierung verwendet Feature-Prognose - Chebyshev-Prognose und Gratregression -, um Zwischentransformatorfunktionen vorherzusagen, und lässt das Modell das Ergebnis weiter verfeinern. Es ist weniger wie das Fotokopieren des vorherigen Passes und mehr wie das Skizzieren des nächsten aus der jüngsten Flugbahn, bevor das Modell es aufräumt.

Das macht Spectrum technisch interessant. Es hat es in diesem speziellen Test nicht schnell gemacht.

Was es verändert EasyCache + SageAttention Spektrum
Grundidee Vorherige Berechnung wiederverwenden und Aufmerksamkeitskosten reduzieren Vorhersage von Zwischenmerkmalen aus der jüngeren Geschichte
Woher der Gewinn kommt Mehr wiederholte Arbeit überspringen Vermeiden Sie einige Transformator Berechnung
Wahrscheinlicher Trade-Off Mehr Möglichkeiten für akkumulierte Drift Konservativere Beschleunigung
Ergebnis dieses Tests 692.69s 1.590.15s

Was fehlt, ist ein richtiges visuelles A/B: derselbe Seed, die gleiche Quelle, die gleiche Eingabeaufforderung, die gleichen Sampling-Einstellungen, beide Ausgaben in voller Qualität. Ohne das kann ich Ihnen sagen, welcher Lauf zuerst beendet wurde. Ich kann Ihnen nicht ehrlich sagen, welche Methode mehr Details bewahrt hat.

Diese Unterscheidung ist wichtig. So versuchen wir auch, einen Anbieteranspruch von einem beobachtbaren Ergebnis in der NSFWAITool Überprüfungsmethode. Eine Stoppuhr kann Geschwindigkeit beweisen. Es kann die Bildqualität nicht von selbst nachweisen.

Das „NSFW MiniMax H3 Modell benötigt ein Sternchen

Die hier diskutierte NSFW-Version war Kein offizielles MiniMax Release. Die offizielles MiniMax H3-Repository beschreibt ein Mehrzweck-Multimodalmodell. Der auf Erwachsene ausgerichtete Build stammte von einem unabhängigen Community-Feintuner, der Berichten zufolge fünf Versionen getestet hat.

Der Link verschwand schnell und gab bereits eine 404 zurück, als er überprüft wurde. Das ist ärgerlich, aber es ist auch normal in dieser Ecke der Open-Source-KI: Ein Modell kann veröffentlicht, gespiegelt, umbenannt oder gelöscht werden, bevor die meisten Leute es herunterladen. Wenn ein Produktionsworkflow davon abhängt, dass ein nicht verifiziertes Community-Repository für immer online bleibt, existiert der Workflow noch nicht wirklich.

Der ursprüngliche test verwendete eine lange, multi-kamera-mode-aufforderung für die baseline. Es spezifizierte eine vertikale 15-Sekunden-Rolle, mehrere Linsen und Winkel, konsistentes Styling, Musik, Beleuchtung und Identität über Schnitte hinweg. Das normale H3-Ergebnis ist unten.

Baseline MiniMax H3 Modeausgabe. Die sichtbare V-Markierung ist Teil des Quellclips und wurde beibehalten. Quelle: 赵KK搞AI.

Für den erwachsenentest behielt die prompte die gleiche multi-kamera-struktur bei, änderte jedoch die garderobe-progression in eine explizite ausziehsequenz. Das ist ein sinnvoller Weg, um eine Feinabstimmung zu testen: Bewahren Sie das Schussdesign und ändern Sie das Verhalten, das Sie tatsächlich messen möchten.

Hier ist das öffentliche Ergebnis, das im Originalartikel enthalten ist:

Veröffentlichter Teaser für die Community NSFW fine-tune. Die ursprünglichen chinesischen Untertitel wurden durch englische Untertitel ersetzt; die Markierung "V" bleibt Teil des Quellvideos. Quelle: 赵KK搞AI.

Und hier muss ich das Marketing ein wenig verderben: der öffentliche Clip zeigt nicht die vollständige Abziehsequenz, die in der Aufforderung beschrieben ist. Die Figur bleibt bekleidet, und am Ende sagt sie sinngemäß neckisch: „Wenn Sie es wirklich sehen möchten, probieren Sie es selbst aus.“ Unterhaltsam? Ja. Ein Beleg für das vollständig unzensierte Verhalten? Nein.

Also würde ich dies als Beweis dafür behandeln, dass eine Community NSFW H3 Feinabstimmung existierte und einen kohärenten Teaser zum Thema Erwachsene produzieren könnte. Ich würde den öffentlichen clip nicht als beweis dafür verwenden, dass er jede explizite anweisung abgeschlossen hat. Das sind zwei verschiedene Behauptungen, und sie zusammenzudrücken ist, wie KI-Demos zu Unsinn werden.

Wenn sie gehostete und lokale erwachsenen-video-optionen vergleichen, ist die breitere. AI Porno Video Generator Verzeichnis ist ein besserer Ausgangspunkt, als alles auf ein gelöschtes Repository zu setzen.

Wan-Animate-2 wurde Open Source, also ja, ich habe das auch getestet

Wan-Animate-2 veröffentlichte seinen Inferenzcode und Modellgewichte im August 2026. Das Projekt steuert eine Referenzfigur direkt aus einem Quellvideo, während es versucht, Identität, Bewegung, Ausdruck und Kameraverhalten zu bewahren. Es ist ein End-to-End-System, so dass es keinen separaten Pose-Extraktor in der Mitte der Pipeline benötigt.

Englische Übersicht der Wan-Animate-2 End-to-End Charakteranimation Pipeline

Wan-Animate-2-Pipeline-Übersicht im Originalartikel enthalten. Quelle: 赵KK搞AI; technische Details: Projekt Wan-Animate-2.

Schneller Umweg, denn anscheinend muss noch gesagt werden: Wan 3.0 ist nicht Open Source. Das ist enttäuschend. Es macht keinen anonymen Missbrauch, der auf die Entwickler abzielt, clever oder prinzipiell. Sie verwenden Modelle, die andere Leute monatelang gebaut haben, und handeln dann persönlich verraten, weil sie Ihnen den nächsten nicht nach Ihrem bevorzugten Zeitplan übergeben haben. Wenn Sie Wan 4.0 selbst bauen können, tun Sie es bitte. Ich werde der Erste in der Reihe sein und Sie bitten, die Gewichte freizugeben.

Wan-Animate-2, das Open Source ist, erledigt das Wan 3.0-Argument nicht magisch, aber es ist immer noch eine sinnvolle Veröffentlichung. Das Wan-Ökosystem bleibt einer der wenigen Orte, an denen Menschen das Modell tatsächlich in einer privaten ComfyUI-Pipeline inspizieren, modifizieren und verkabeln können. Das ist noch wichtiger für erwachsene projekte, in denen gehostete produkte das material möglicherweise überhaupt nicht zulassen. Unsere längeren Wan 2.2 Kurzfilm-Workflow für Erwachsene erklärt, warum die lokale Steuerung zu einer Produktionsanforderung wird, sobald ein Projekt über ein paar Clips hinauswächst.

Das Wan-Animate-2-Setup hat einen leicht verpassten Schritt

Vor dem Ausführen der Animation sollte das Referenzbild mit einem LLM beschrieben werden. Das offizielle Projekt empfiehlt eine objektive Beschreibung des Aussehens und des Hintergrunds des Charakters, wobei Handlungen, subjektive Urteile und emotionale Spekulationen ausgeschlossen werden.

Im natürlichen Englisch lautet die Anweisung im Wesentlichen:

Beschreiben Sie nur, was im Referenzbild sichtbar vorhanden ist. Bedecken Sie das Aussehen, die Kleidung, die Haare, das Zubehör und den Hintergrund des Themas. Beschreiben Sie keine Handlungen. Erraten Sie nicht Persönlichkeit, Stimmung oder Absicht.

Das klingt pingelig, bis Sie sehen, warum es hilft. Das Fahrvideo liefert bereits die Action. Wenn die textbeschreibung eine andere aktion erfindet, haben sie dem modell zwei regisseure gegeben, die verschiedene anweisungen schreien.

Wan-Animate-2-Workflow läuft innerhalb einer englischen ComfyUI-Schnittstelle

Wan-Animate-2 in ComfyUI. Quelle: 赵KK搞AI.

Die andere Einstellung, die Leute falsch machen, ist die Rahmenlänge. Bei 24 fps ist die Mathematik einfach:

Dauer in Sekunden × 24 = Zielbildzahl

Der in der Quelle gezeigte Workflow verwendet 81-Frame-Stücke, so dass längere Clips mehrere Durchläufe erfordern.

Ziellaufzeit Frames bei 24 fps 81-Frame-Stücke benötigt
3 Sekunden 72 1
5 Sekunden 120 2
8 Sekunden 192 3
10 Sekunden 240 mm 3
15 Sekunden 360 mm 5
30 Sekunden 720 9

Englisch Wan-Animate-2 ComfyUI-Knoten mit auf 81 eingestellter Rahmenlänge

Die im Workflow verwendete 81-Frame-Längeneinstellung. Quelle: 赵KK搞AI.

Das standardmäßige 720p-Setup des offiziellen Repositorys ist auf acht A800-GPUs abgestimmt, mit einer getesteten 480p-Konfiguration auf zwei A800. Das ist keine freundliche kleine "Klick Queue Prompt auf meinem Laptop" Anforderung. Community-Optimierungen werden den Speicherboden weiter nach unten schieben, aber jeder, der darüber schreibt, als ob die lokale Zeichenanimation kostenlos wäre, hat eindeutig noch nie einen Fortschrittsbalken gesehen, der durch einen echten Workflow krabbelt.

Wan-Animate-2 gegen SCAIL-2: Die Clips erweisen sich nicht als Gewinner

Die SCAIL-2 Das Projekt nimmt eine ähnliche End-to-End-Route ein. Es vermeidet eine Zwischenposendarstellung und fügt Maskensemantik plus Multireferenzkonditionierung hinzu. Die offizielle Version unterstützt 512p- und 704p-Workflows, wobei das Projekt die posengesteuerte Variante bei 704p empfiehlt.

Hier ist die Wan-Animate-2-Probe aus dem Originalartikel erhalten:

Wan-Animate-2-Probe. Die Quelldatei wechselt schnell die Fahr-/Referenzansicht und das erzeugte Zeichen; sie wird hier unverändert wiedergegeben. Quelle: 赵KK搞AI.

Und hier ist die SCAIL-2-Probe:

SCAIL-2-Zeichenanimationsprobe. Quelle: 赵KK搞AI.

Ich werde keinen Gewinner aus diesen beiden Clips ankündigen, denn das wäre falsche Präzision. Sie verwenden unterschiedliche Charaktere, unterschiedliche Bewegungsquellen, unterschiedliches Framing und unterschiedliche Dauern. Der Wan-Animate-2-Upload dauert nur etwa 2,7 Sekunden und wechselt die Ansichten so schnell, dass zeitliche Defekte schwer zu beurteilen sind. Der SCAIL-2-Clip läuft fast neun Sekunden und ist viel einfacher zu inspizieren, aber "einfacher zu inspizieren" ist nicht dasselbe wie "besseres Modell".

Ein echter Vergleich erfordert das gleiche Referenzbild, Fahrvideo, Auflösung, Bildanzahl, Hardware, Seed-Richtlinie und Nachbearbeitung. Dann würde ich Identitätserhaltung, Handstabilität, Okklusionswiederherstellung, Gesichtsausdruck, Stoffbewegung, Hintergrundleckage und Gesamtwiedergabezeit punkten. Alles andere ist ein Demo-Rollen-Vergleich.

Was ich nach diesen Tests tatsächlich verwenden würde

Für MiniMax H3 Iterationsgeschwindigkeit würde ich beginnen mit EasyCache + SageAttention. Die Lücke in diesem Lauf ist zu groß, um sie zu ignorieren. Ich würde immer noch eine Handvoll übereinstimmender Samples machen, bevor ich den Qualitätskompromiss akzeptiere, denn Geschwindigkeit, die Gesichter oder Bewegung leise schädigt, ist keine Geschwindigkeit - sie erzeugt nur schneller Ausschuss.

Ich würde behandeln Spektrum als die interessante, konservativere Alternative, nicht der Gewinner dieser Timingrunde. Es verdient einen kontrollierten Qualitätstest, besonders wenn EasyCache beginnt, sichtbare Fehler in einem längeren oder schwierigeren Schuss zu akkumulieren.

Für die Community NSFW H3 FeinsteuerungIch würde auf ein stabiles Repository, eine Modellkarte, einen Versionsverlauf und reproduzierbare Samples warten. Ein verschwundener link und ein coy teaser sind genug, um mich neugierig zu machen. Sie reichen nicht aus, um einen Produktionsworkflow aufzubauen.

für Wan-Animate-2 gegen SCAIL-2Ich würde meine eigenen Matched Inputs ausführen. Beide Projekte sind offen genug, um ernsthafte Tests zu verdienen. Die Proben im Originalartikel beantworten die Frage einfach nicht.

Das klingt vielleicht weniger aufregend als "Model A zerstört Model B", aber es ist viel nützlicher. Es gibt bereits genug gefälschte Sicherheit im KI-Benchmarking. Wir müssen keinen weiteren gewinner aus zwei nicht verwandten videos herstellen.

Häufig gestellte Fragen

Ist MiniMax H3 offiziell ein NSFW-Modell?

Nein. MiniMax H3 ist ein universelles multimodales Modell. Der hier diskutierte NSFW-Build war eine unabhängige Community-Feinabstimmung, keine offizielle MiniMax-Version.

Ist EasyCache immer schneller als Spectrum auf MiniMax H3?

Nicht bewiesen. EasyCache + SageAttention war in diesem spezifischen 15-Sekunden-Test mit 544 × 960 etwa 2,3 Mal schneller. Verschiedene Hardware, Seeds, Node-Versionen und Qualitätseinstellungen können das Ergebnis verändern.

Hat die öffentliche NSFW-Demo die vollständige explizite Aufforderung abgeschlossen?

Der veröffentlichte Clip zeigt das nicht. Es bleibt bekleidet und endet als Teaser, so dass es die vollständige Abziehsequenz, die in der Aufforderung beschrieben wird, nicht überprüfen kann.

Ist Wan-Animate-2 besser als SCAIL-2?

Die beiden Quellclips sind kein kontrollierter Vergleich. Sie verwenden unterschiedliche Eingaben und Längen, so dass sie zeigen, dass beide Workflows laufen - nicht der bessere.

Warum verwendet der Wan-Animate-2-Workflow 81 Frames?

Das ist die Chunklänge, die im demonstrierten ComfyUI-Workflow verwendet wird. Bei 24 fps werden längere Ziele auf mehrere 81-Frame-Brocken aufgeteilt und dann zusammengebaut.

Wie viel GPU-Hardware benötigt Wan-Animate-2?

Das offizielle Projekt dokumentiert ein standardmäßiges 720p-Setup auf acht A800-GPUs und ein getestetes 480p-Setup auf zwei A800. Community Nodes und Offloading können die Anforderung reduzieren, in der Regel auf Kosten der Geschwindigkeit.

Können diese Modelle für Inhalte für Erwachsene verwendet werden?

Die lokale Verfügbarkeit hebt die gesetzlichen oder Zustimmungsanforderungen nicht auf. Verwenden Sie nur eindeutig erwachsene Charaktere und ordnungsgemäß lizenzierte Referenzbilder, Stimmen und Fahrmaterial. Erstellen Sie keine intimen Deepfakes von echten Menschen ohne Zustimmung.