N NSFWAITool
Français

Tests MiniMax H3 NSFW : EasyCache vs Spectrum, plus Wan-Animate-2 vs SCAIL-2

Test d'accélération et d'animation de personnages MiniMax H3 comparant EasyCache, Spectrum, Wan-Animate-2 et SCAIL-2

Hier, j'ai fini de tester une configuration d'accélération MiniMax H3. Aujourd'hui, un autre a atterri.

Bien sûr que c’était le cas.

C'est ComfyUI dans 2026 : votre benchmark est à peine froid avant que quelqu'un ne publie un nouveau nœud et donne l'impression que le tout est obsolète. La configuration d'hier était EasyCache plus SageAttention. Les ajouts d'aujourd'hui étaient Spectrum et un autre plugin de vitesse circulant dans la communauté chinoise ComfyUI. À peu près au même moment, Wan-Animate-2 est finalement devenu open source, ce qui m'a donné une excuse supplémentaire pour le comparer avec SCAIL-2.

Cela s'est donc transformé en trois tests plutôt qu'un :

  • EasyCache + SageAttention contre Spectrum sur MiniMax H3 ;
  • la sortie H3 régulière par rapport à un réglage fin NSFW créé par la communauté ;
  • Wan-Animate-2 versus SCAIL-2 pour l'animation de personnages.

La version courte : EasyCache a remporté le test de timing d'un mile, le clip NSFW publié prouve moins que ce que prétend l'invite, et les deux échantillons d'animation de personnages sont loin d'être suffisamment contrôlés pour couronner un gagnant. La version longue est plus intéressante.

NDLR : Il s'agit d'une adaptation en anglais natif de notes pratiques initialement publiées par 赵KK搞AI sur WeChat, pas une traduction ligne par ligne. Les résultats des tests à la première personne et les opinions sont conservés de l'auteur original ; le contexte technique et les mises en garde ont été vérifiés par rapport aux référentiels officiels du projet.

Tout d'abord, le test de vitesse : 692 secondes contre 1,590 secondes

Les deux exécutions MiniMax H3 ont généré un clip vertical de 15 secondes à 544 × 960. Le workflow EasyCache + SageAttention s'est terminé en 692.69 secondes, ou environ 11 minutes 33 secondes. Le spectre a pris 1,590.15 secondes, ou environ 26 minutes 30 secondes.

Cela fait à peu près EasyCache + SageAttention 2.3× plus rapide dans cette exécution. Cela a réduit le temps d'attente d'un peu plus de 56%.

Configuration du MiniMax H3 Sortir Temps mesuré Résultat relatif
EasyCache + SageAttention 15s, 544 × 960 692.69 1.0×
Spectre 15s, 544 × 960 1,590.15 2.3× plus long

Interface ComfyUI en anglais complétant l'exécution de MiniMax H3 EasyCache et SageAttention en 692.69 secondes

EasyCache + SageAttention s'exécute comme enregistré dans ComfyUI. Image source : 赵KK搞AI.

Historique des tâches ComfyUI en anglais affichant 1,590.15 secondes pour Spectrum et 692.69 secondes pour EasyCache plus SageAttention

Les deux temps de tâche enregistrés. C'est la capture d'écran utile ; cela nous évite de prétendre que « se sentir plus vite » est une référence. Image source : 赵KK搞AI.

La sortie 15-seconde MiniMax H3 attachée au test d'accélération. Vidéo source : 赵KK搞AI.

Avant que quiconque ne transforme ce chiffre 2.3× en une loi universelle : ne le faites pas. L'article ne fournit pas de feuille de reproductibilité complète avec le modèle GPU, les versions logicielles, les graines, les paramètres d'échantillonnage et les paramètres par nœud. Il s’agit d’un véritable résultat de flux de travail, et non d’un classement de vitesse évalué par des pairs.

Pourtant, une différence aussi importante n’est pas rien. Si ma seule question était « quelle configuration me permet d'obtenir un autre brouillon plus tôt sur cette machine ? », EasyCache + SageAttention serait le premier choix évident.

Pourquoi EasyCache était plus rapide ici

Les deux accélérateurs ne font pas la même chose.

EasyCache est l'approche la plus agressive. En clair, il essaie de réutiliser le travail des étapes de débruitage précédentes au lieu de réexécuter le calcul complet à chaque fois. Lorsque la génération reste stable, cela peut économiser beaucoup de calcul. Le risque est tout aussi simple à comprendre : si l’estimation mise en cache commence à dériver, l’erreur peut s’accumuler.

Spectre est plus retenu. Son implémentation ComfyUI utilise la prévision des caractéristiques (prévision de Chebyshev et régression de crête) pour prédire les caractéristiques intermédiaires du transformateur, puis laisse le modèle continuer à affiner le résultat. Il s’agit moins de photocopier la passe précédente que de dessiner la suivante à partir de la trajectoire récente avant que le modèle ne la nettoie.

Cela rend Spectrum techniquement intéressant. Il n’a pas été rapide dans ce test particulier.

Ce que ça change EasyCache + SageAttention Spectre
Idée de base Réutilisez les calculs antérieurs et réduisez le coût d’attention Prévoir les caractéristiques intermédiaires de l'historique récent
D’où vient le gain Sauter des travaux plus répétés Éviter certains calculs de transformateur
Compromis probable Plus de possibilités de dérive accumulée Une accélération plus conservatrice
Résultat à ce test 692.69 1,590.15

Ce qui manque, c'est un A/B visuel approprié : même graine, même source, même invite, mêmes paramètres d'échantillonnage, les deux sorties disponibles en pleine qualité. Sans cela, je peux vous dire quelle manche s'est terminée en premier. Honnêtement, je ne peux pas vous dire quelle méthode a préservé le plus de détails.

Cette distinction est importante. C'est également ainsi que nous essayons de séparer une affirmation d'un fournisseur d'un résultat observable dans le Méthodologie de révision de NSFWAITool. Un chronomètre peut prouver la vitesse. Il ne peut pas prouver à lui seul la qualité de l’image.

Le « modèle NSFW MiniMax H3 » a besoin d'un astérisque

La version NSFW discutée ici était pas une version officielle de MiniMax. Le référentiel officiel MiniMax H3 décrit un modèle multimodal à usage général. La version destinée aux adultes provenait d'un peaufineur communautaire indépendant qui aurait testé cinq versions.

Le lien a disparu rapidement et renvoyait déjà un 404 lorsqu'il était vérifié. C'est ennuyeux, mais c'est également normal dans ce coin de l'IA open source : un modèle peut être publié, mis en miroir, renommé ou supprimé avant que la plupart des gens aient fini de le télécharger. Si un workflow de production dépend d’un référentiel communautaire non vérifié restant en ligne pour toujours, le workflow n’existe pas encore vraiment.

Le test original utilisait une longue invite de mode multi-caméras pour la ligne de base. Il spécifiait une bobine verticale de 15 secondes, plusieurs objectifs et angles, un style, une musique, un éclairage et une identité cohérents dans toutes les coupes. Le résultat H3 normal est ci-dessous.

Sortie de mode MiniMax H3 de base. La marque « V » visible fait partie du clip source et a été conservée. Vidéo source : 赵KK搞AI.

Pour le test adulte, l'invite a conservé la même structure multi-caméras mais a modifié la progression de la garde-robe en une séquence de déshabillage explicite. C'est une façon judicieuse de tester un réglage fin : préserver la conception du plan et modifier le comportement que vous souhaitez réellement mesurer.

Voici le résultat public inclus avec l’article original :

Teaser publié pour la mise au point de la communauté NSFW. Les légendes originales en chinois ont été remplacées par des sous-titres en anglais ; la marque « V » reste une partie de la vidéo source. Vidéo source : 赵KK搞AI.

Et c’est ici que je dois gâcher un peu le marketing : le clip public ne montre pas la séquence de déshabillage complète décrite dans l'invite. Il reste habillé et se termine par une phrase taquine qui revient à : « Si vous voulez vraiment le voir, essayez-le vous-même. » Drôle? Oui. Preuve d'un comportement totalement non censuré ? Non.

Je considérerais donc cela comme une preuve qu'un réglage fin de la communauté NSFW H3 existait et pourrait produire un teaser cohérent sur le thème des adultes. Je n'utiliserais pas le clip public comme preuve qu'il a exécuté toutes les instructions explicites. Ce sont deux affirmations différentes, et les écraser ensemble est la façon dont les démonstrations d’IA se transforment en absurdités.

Si vous comparez les options de vidéos pour adultes hébergées et locales, le plus large Répertoire du générateur de vidéos porno IA est un meilleur point de départ que de tout miser sur un référentiel supprimé.

Wan-Animate-2 est devenu open source, alors oui, je l'ai testé aussi

Wan-Animer-2 a publié son code d'inférence et ses poids de modèle en août 2026. Le projet génère un personnage de référence directement à partir d'une vidéo source tout en essayant de préserver l'identité, le mouvement, l'expression et le comportement de la caméra. Il s’agit d’un système de bout en bout, il n’a donc pas besoin d’un extracteur de pose séparé placé au milieu du pipeline.

Présentation en anglais du pipeline d'animation de personnages de bout en bout Wan-Animate-2

Présentation du pipeline Wan-Animate-2 incluse dans l'article d'origine. Image source : 赵KK搞AI ; détails techniques : projet Wan-Animate-2.

Petit détour, car apparemment il faut encore le dire : Wan 3.0 n'est pas open source. C'est décevant. Cela ne rend pas les abus anonymes destinés aux développeurs intelligents ou fondés sur des principes. Vous utilisez des modèles que d'autres personnes ont passé des mois à construire, puis vous vous comportez personnellement trahi parce qu'ils ne vous ont pas remis le suivant selon votre horaire préféré. Si vous pouvez créer Wan 4.0 vous-même, faites-le. Je serai en première ligne pour vous demander de libérer les poids.

Le fait que Wan-Animate-2 soit open source ne règle pas comme par magie l'argument Wan 3.0, mais il s'agit toujours d'une version significative. L'écosystème Wan reste l'un des rares endroits où les gens peuvent réellement inspecter, modifier et connecter le modèle à un pipeline ComfyUI privé. Cela est encore plus important pour les projets pour adultes, où les produits hébergés peuvent ne pas autoriser du tout le contenu. Notre plus long Flux de travail des courts métrages pour adultes Wan 2.2 explique pourquoi le contrôle local devient une exigence de production une fois qu'un projet dépasse quelques clips.

La configuration Wan-Animate-2 comporte une étape facilement manquée

Avant d'exécuter l'animation, l'image de référence doit être décrite avec un LLM. Le projet officiel recommande une description objective de l'apparence et des antécédents du personnage tout en excluant les actions, les jugements subjectifs et les spéculations émotionnelles.

En anglais naturel, l’instruction est essentiellement :

Décrivez uniquement ce qui est visiblement présent dans l’image de référence. Couvrez l'apparence, les vêtements, les cheveux, les accessoires et l'arrière-plan du sujet. Ne décrivez pas les actions. Ne devinez pas la personnalité, l’humeur ou l’intention.

Cela semble difficile jusqu'à ce que vous compreniez pourquoi cela aide. La vidéo de conduite fournit déjà l'action. Si la description textuelle invente une autre action, vous avez donné au modèle deux réalisateurs criant des instructions différentes.

Flux de travail Wan-Animate-2 exécuté dans une interface ComfyUI en anglais

Wan-Animate-2 dans ComfyUI. Image source : 赵KK搞AI.

L’autre paramètre que les gens se trompent est la longueur de l’image. À 24 fps, le calcul est simple :

durée en secondes × 24 = nombre d'images cible

Le flux de travail présenté dans la source utilise des blocs d'images 81, de sorte que les clips plus longs nécessitent plusieurs passes.

Durée cible Images à 24 fps Morceaux de trame 81 nécessaires
3 secondes 72 1
5 secondes 120 2
8 secondes 192 3
10 secondes 240 3
15 secondes 360 5
30 secondes 720 9

Nœud ComfyUI anglais Wan-Animate-2 avec la longueur de trame définie sur 81

Le paramètre de longueur de trame 81 utilisé dans le flux de travail. Image source : 赵KK搞AI.

La configuration 720p par défaut du référentiel officiel est réglée pour huit GPU A800, avec une configuration 480p testée sur deux A800. Ce n’est pas une petite exigence amicale de « cliquer sur l’invite de file d’attente sur mon ordinateur portable ». Les optimisations de la communauté continueront à réduire la mémoire, mais quiconque écrit à ce sujet comme si l'animation de personnages locaux était gratuite n'a clairement jamais vu une barre de progression parcourir un flux de travail réel.

Wan-Animate-2 versus SCAIL-2 : les clips ne s'avèrent pas gagnants

Le SCAIL-2 Le projet emprunte un chemin similaire de bout en bout. Il évite une représentation de pose intermédiaire et ajoute une sémantique de masque ainsi qu'un conditionnement multi-référence. Sa version officielle prend en charge les flux de travail 512p et 704p, le projet recommandant la variante basée sur la pose à 704p.

Voici l'échantillon Wan-Animate-2 conservé de l'article original :

Échantillon Wan-Animate-2. Le fichier source alterne rapidement la vue de conduite/référence et le personnage généré ; il est reproduit ici sans modification. Vidéo source : 赵KK搞AI.

Et voici l'exemple SCAIL-2 :

Exemple d'animation de personnage SCAIL-2. Vidéo source : 赵KK搞AI.

Je ne vais pas annoncer le gagnant de ces deux clips, car ce serait une fausse précision. Ils utilisent différents personnages, différentes sources de mouvement, différents cadrages et différentes durées. Le téléchargement Wan-Animate-2 ne dure qu'environ 2.7 secondes et alterne les vues si rapidement que les défauts temporels sont difficiles à juger. Le clip SCAIL-2 fonctionne pendant près de neuf secondes et est beaucoup plus facile à inspecter, mais « plus facile à inspecter » n'est pas la même chose que « meilleur modèle ».

Une véritable comparaison nécessite la même image de référence, la même vidéo de conduite, la même résolution, le nombre d'images, le matériel, la même politique de départ et le même post-traitement. Ensuite, j'évaluerais la rétention d'identité, la stabilité des mains, la récupération de l'occlusion, l'expression du visage, le mouvement du tissu, les fuites en arrière-plan et le temps de rendu total. Rien de moins n’est une comparaison de bobines de démonstration.

Ce que j'utiliserais réellement après ces tests

Pour la vitesse d'itération du MiniMax H3, je commencerais par EasyCache + SageAttention. L’écart dans cette série est trop important pour être ignoré. Je restituerais quand même une poignée d'échantillons correspondants avant d'accepter le compromis de qualité, car la vitesse qui endommage discrètement les visages ou les mouvements n'est pas de la vitesse : elle génère simplement des rejets plus rapidement.

je traiterais Spectre comme l’alternative intéressante et plus conservatrice, et non comme le vainqueur de ce tour de timing. Il mérite un test de qualité contrôlé, surtout si EasyCache commence à accumuler des erreurs visibles dans un plan plus long ou plus difficile.

Pour le communauté NSFW H3 peaufiner, j'attendrais un référentiel stable, une carte de modèle, un historique des versions et des échantillons reproductibles. Un lien disparu et un teaser timide suffisent à me rendre curieux. Ils ne suffisent pas pour construire un flux de production.

Pour Wan-Animate-2 contre SCAIL-2, j'exécuterais mes propres entrées correspondantes. Les deux projets sont suffisamment ouverts pour mériter des tests sérieux. Les exemples de l’article original ne répondent tout simplement pas à la question.

Cela peut paraître moins excitant que « Le modèle A détruit le modèle B », mais c’est bien plus utile. Il existe déjà suffisamment de fausses certitudes dans l’analyse comparative de l’IA. Nous n’avons pas besoin de fabriquer un autre gagnant à partir de deux vidéos sans rapport.

Questions fréquemment posées

Le MiniMax H3 est-il officiellement un modèle NSFW ?

Non. Le MiniMax H3 est un modèle multimodal à usage général. La version NSFW discutée ici était un réglage fin de la communauté indépendante, et non une version officielle de MiniMax.

EasyCache est-il toujours plus rapide que Spectrum sur MiniMax H3 ?

Pas prouvé. EasyCache + SageAttention était environ 2.3 × plus rapide dans ce test spécifique de 15 secondes, 544 × 960. Différents matériels, graines, versions de nœuds et paramètres de qualité peuvent modifier le résultat.

La démo publique NSFW a-t-elle complété l'invite explicite complète ?

Le clip publié ne le montre pas. Il reste habillé et se termine comme un teaser, il ne peut donc pas vérifier la séquence de déshabillage complète décrite dans l'invite.

Wan-Animate-2 est-il meilleur que SCAIL-2?

Les deux clips sources ne constituent pas une comparaison contrôlée. Ils utilisent des entrées et des longueurs différentes, ils montrent donc que les deux flux de travail s'exécutent, sans déterminer lequel est le meilleur.

Pourquoi le workflow Wan-Animate-2 utilise-t-il des images 81 ?

Il s'agit de la longueur de bloc utilisée dans le flux de travail ComfyUI démontré. À 24 fps, les cibles plus longues sont divisées en plusieurs morceaux d'images 81, puis assemblées.

De quelle quantité de matériel GPU Wan-Animate-2 a-t-il besoin ?

Le projet officiel documente une configuration 720p par défaut sur huit GPU A800 et une configuration 480p testée sur deux A800. Les nœuds communautaires et le déchargement peuvent réduire les besoins, généralement au détriment de la vitesse.

Ces modèles peuvent-ils être utilisés pour du contenu pour adultes ?

La disponibilité locale ne supprime pas les exigences légales ou de consentement. Utilisez uniquement des personnages clairement adultes et des images de référence, des voix et des séquences de conduite sous licence appropriée. Ne créez pas de deepfakes intimes de vraies personnes sans consentement.