Ontem terminei de testar uma configuração de aceleração MiniMax H3. Hoje aterrou mais um.
Claro que sim.
Este é o ComfyUI em 2026: o seu benchmark mal arrefece antes que alguém liberte um novo nó e faça com que tudo pareça desatualizado. A configuração de ontem foi EasyCache mais SageAttention. As adições de hoje foram o Spectrum e outro plugin de velocidade que circula na comunidade chinesa ComfyUI. Quase ao mesmo tempo, Wan-Animate-2 tornou-se finalmente open source, o que me deu mais uma desculpa para o comparar com SCAIL-2.
Então, isto transformou-se em três testes em vez de um:
- EasyCache + SageAttention versus Spectrum no MiniMax H3;
- a saída H3 regular versus um ajuste fino de NSFW feito pela comunidade;
- Wan-Animate-2 versus SCAIL-2 para animação de personagens.
A versão curta: EasyCache venceu o teste de tempo por larga margem, o clipe NSFW publicado prova menos do que as afirmações imediatas e as duas amostras de animação de personagens estão longe de serem controladas o suficiente para coroar um vencedor. A versão mais longa é mais interessante.
Nota do editor: Esta é uma adaptação para inglês nativo de notas práticas originalmente publicadas por 赵KK搞AI no WeChat, e não uma tradução linha a linha. Os resultados e opiniões dos testes na primeira pessoa são retidos do autor original; o contexto técnico e as advertências foram verificados nos repositórios oficiais do projeto.
Em primeiro lugar, o teste de velocidade: 692 segundos versus 1,590 segundos
Ambas as execuções do MiniMax H3 geraram um clip vertical de 15 de segundo em 544 × 960. O fluxo de trabalho EasyCache + SageAttention terminou em 692.69 segundos, ou sobre 11 minutos 33 segundos. Espectro levou 1,590.15 segundos, ou sobre 26 minutos 30 segundos.
Isto torna o EasyCache + SageAttention aproximadamente 2.3× mais rápido nesta execução. Reduziu um pouco o tempo de espera em 56%.
| Configuração MiniMax H3 | Saída | Tempo medido | Resultado relativo |
|---|---|---|---|
| EasyCache + SageAttention | 15s, 544 × 960 | 692.69s | 1.0× |
| Espectro | 15s, 544 × 960 | 1,590.15s | 2.3× mais longo |

O EasyCache + SageAttention é executado conforme registado no ComfyUI. Imagem de origem: 赵KK搞AI.

Os dois tempos de tarefa registados. Esta é a captura de ecrã útil; evita-nos fingir que “nos sentimos mais rápidos” é uma referência. Imagem de origem: 赵KK搞AI.
A saída MiniMax H3 de 15 ligada ao teste de aceleração. Fonte do vídeo: 赵KK搞AI.
Antes que alguém transforme este número 2.3× numa lei universal: não o faça. O artigo não fornece uma folha de reprodutibilidade completa com o modelo de GPU, versões de software, sementes, parâmetros de amostragem e definições por nó. Este é um resultado real do fluxo de trabalho, não um placar de velocidade revisto por pares.
Ainda assim, uma diferença tão grande não é nada. Se minha única pergunta fosse “qual configuração me dá outro rascunho mais cedo nesta máquina?”, EasyCache + SageAttention seria a primeira escolha óbvia.
Porque é que o EasyCache foi mais rápido aqui
Os dois aceleradores não estão a fazer o mesmo.
O EasyCache é a abordagem mais agressiva. Em linguagem simples, tenta reutilizar o trabalho das etapas anteriores de remoção de ruído, em vez de executar o cálculo completo novamente sempre. Quando a geração permanece estável, isto pode poupar muita computação. O risco é igualmente fácil de compreender: se a estimativa em cache começar a oscilar, o erro pode acumular-se.
Espectro é mais contido. Sua implementação ComfyUI usa previsão de recursos – previsão de Chebyshev e regressão de crista – para prever recursos intermediários do transformador e, em seguida, permite que o modelo continue refinando o resultado. É menos como fotocopiar a passagem anterior e mais como esboçar a próxima da trajetória recente antes de o modelo a limpar.
Isto torna o Spectrum tecnicamente interessante. Não foi rápido neste teste específico.
| O que muda | EasyCache + SageAttention | Espectro |
|---|---|---|
| Ideia básica | Reutilize a computação anterior e reduza o custo de atenção | Previsão de recursos intermédios do histórico recente |
| De onde vem o ganho | Ignorando trabalhos mais repetidos | Evitando algum cálculo do transformador |
| Provável compensação | Mais oportunidades para o desvio acumulado | Aceleração mais conservadora |
| Resultado neste teste | 692.69s | 1,590.15s |
O que falta é um A/B visual adequado: mesma semente, mesma fonte, mesmo prompt, mesmas definições de amostragem, ambas as saídas disponíveis com qualidade total. Sem isso, posso dizer qual a corrida que terminou primeiro. Não posso dizer honestamente qual o método que preservou mais detalhes.
Esta distinção é importante. É também como tentamos separar uma afirmação do fornecedor de um resultado observável no Metodologia de revisão NSFWAITool. Um cronómetro pode provar velocidade. Não pode provar a qualidade da imagem por si só.
O “modelo NSFW MiniMax H3” necessita de um asterisco
A versão NSFW aqui discutida foi não é um lançamento oficial do MiniMax. O repositório oficial MiniMax H3 descreve um modelo multimodal de uso geral. A versão destinada a adultos veio de um afinador da comunidade independente que terá testado cinco versões.
O link desapareceu rapidamente e já estava a devolver 404 quando verificado. Isso é irritante, mas também é normal neste canto da IA de código aberto: um modelo pode ser lançado, espelhado, renomeado ou excluído antes que a maioria das pessoas termine de baixá-lo. Se um fluxo de trabalho de produção depende de um repositório da comunidade não verificado permanecer on-line para sempre, o fluxo de trabalho ainda não existe.
O teste original utilizou um prompt de moda longo e com várias câmaras como linha de base. Ele especificou um rolo vertical de 15 de segundo, múltiplas lentes e ângulos, estilo consistente, música, iluminação e identidade em todos os cortes. O resultado normal H3 está abaixo.
Saída de moda MiniMax H3 de base. A marca “V” visível faz parte do clipe de origem e foi mantida. Fonte do vídeo: 赵KK搞AI.
Para o teste adulto, o prompt manteve a mesma estrutura multicâmera, mas mudou a progressão do guarda-roupa para uma sequência explícita de despir. Esta é uma forma sensata de testar um ajuste fino: preservar o design da cena e alterar o comportamento que realmente pretende medir.
Eis o resultado público incluído no artigo original:
Publicado teaser para o ajuste fino da comunidade NSFW. As legendas originais em chinês foram substituídas por legendas em inglês; a marca “V” permanece como parte do vídeo de origem. Fonte do vídeo: 赵KK搞AI.
E é aqui que tenho de estragar um pouco o marketing: o clipe público não mostra a sequência completa de despir descrita no prompt. Mantém-se vestido e termina com uma frase provocadora que equivale a: “Se realmente quer ver, experimente por si”. Engraçado? Sim. Evidência do comportamento completo sem censura? Não.
Portanto, eu trataria isto como uma evidência de que existia um ajuste fino da comunidade NSFW H3 e poderia produzir um teaser coerente com um tema adulto. Eu não usaria o clipe público como prova de que ele completou todas as instruções explícitas. Estas são duas afirmações diferentes, e juntá-las é como as demonstrações de IA se transformam num absurdo.
Se estiver a comparar opções de vídeos para adultos alojados e locais, o mais amplo Diretório gerador de vídeo porno AI é um ponto de partida melhor do que apostar tudo num repositório excluído.
Wan-Animate-2 tornou-se open source, por isso sim, também testei isso
Wan-Animate-2 lançou o seu código de inferência e pesos de modelo em agosto de 2026. O projeto utiliza uma personagem de referência diretamente de um vídeo de origem enquanto tenta preservar a identidade, o movimento, a expressão e o comportamento da câmara. É um sistema de ponta a ponta, pelo que não necessita de um extrator de pose separado no meio do pipeline.

Visão geral do pipeline Wan-Animate-2 incluída no artigo original. Imagem de origem:赵KK搞AI; detalhes técnicos: Projeto Wan-Animate-2.
Desvio rápido, porque aparentemente ainda é preciso dizer: Wan 3.0 não é open source. Isso é decepcionante. Não torna o abuso anónimo dirigido aos programadores inteligentes ou íntegros. Está a usar modelos que outras pessoas passaram meses a construir e depois a agir pessoalmente como traídos porque não lhe entregaram o próximo no horário da sua preferência. Se puder construir o Wan 4.0 por si mesmo, faça-o. Serei o primeiro da fila a pedir-lhe para libertar os pesos.
Wan-Animate-2 ser de código aberto não resolve magicamente o argumento Wan 3.0, mas não deixa de ser um lançamento significativo. O ecossistema Wan continua a ser um dos poucos locais onde as pessoas podem realmente inspecionar, modificar e ligar o modelo num pipeline ComfyUI privado. Isto é ainda mais importante para projetos para adultos, onde os produtos alojados podem não permitir o material. O nosso mais longo Fluxo de trabalho de curtas-metragens para adultos Wan 2.2 explica porque é que o controlo local se torna um requisito de produção quando um projeto ultrapassa alguns clipes.
A configuração Wan-Animate-2 tem um passo facilmente perdido
Antes de executar a animação, a imagem de referência deve ser descrita com um LLM. O projeto oficial recomenda uma descrição objetiva da aparência e do passado da personagem, excluindo ações, julgamentos subjetivos e especulações emocionais.
No inglês natural, a instrução é basicamente:
Descreva apenas o que está visivelmente presente na imagem de referência. Cubra a aparência, as roupas, o cabelo, os acessórios e o fundo do sujeito. Não descreva ações. Não adivinhe personalidade, humor ou intenção.
Isto parece complicado até ver por que razão ajuda. O vídeo de condução já fornece a ação. Se a descrição do texto inventa outra ação, deu ao modelo dois diretores a gritar instruções diferentes.

Wan-Animate-2 em ComfyUI. Imagem de origem: 赵KK搞AI.
A outra definição que as pessoas erram é o comprimento do quadro. Em 24 fps, a matemática é simples:
duração em segundos × 24 = contagem de fotogramas alvo
O fluxo de trabalho mostrado na fonte utiliza pedaços de fotogramas 81, pelo que os clipes mais longos requerem várias passagens.
| Duração desejada | Quadros em 24 fps | Pedaços de quadro 81 necessários |
|---|---|---|
| 3 segundos | 72 | 1 |
| 5 segundos | 120 | 2 |
| 8 segundos | 192 | 3 |
| 10 segundos | 240 | 3 |
| 15 segundos | 360 | 5 |
| 30 segundos | 720 | 9 |

A definição de comprimento do quadro 81 utilizada no fluxo de trabalho. Imagem de origem: 赵KK搞AI.
A configuração 720p padrão do repositório oficial está ajustada para oito GPUs A800, com uma configuração 480p testada em dois A800s. Este não é um requisito amigável de “clique no prompt de fila no meu portátil”. As otimizações da comunidade continuarão a diminuir o nível da memória, mas qualquer pessoa que escreva sobre isto como se a animação de personagens locais fosse gratuita, claramente nunca viu uma barra de progresso a rastejar num fluxo de trabalho real.
Wan-Animate-2 versus SCAIL-2: os clips não são vencedores
O SCAIL-2 projeto segue um caminho semelhante de ponta a ponta. Evita uma representação de pose intermédia e adiciona semântica de máscara para além do condicionamento de múltiplas referências. O seu lançamento oficial suporta os fluxos de trabalho 512p e 704p, com o projeto a recomendar a variante orientada por pose em 704p.
Eis o exemplo Wan-Animate-2 preservado do artigo original:
Amostra Wan-Animate-2. O ficheiro de origem alterna rapidamente a visualização de condução/referência e a personagem gerada; é aqui reproduzido sem alteração. Fonte do vídeo: 赵KK搞AI.
E aqui está o exemplo SCAIL-2:
Exemplo de animação de personagem SCAIL-2. Fonte do vídeo: 赵KK搞AI.
Não vou anunciar o vencedor destes dois clipes, porque isso seria uma falsa precisão. Utilizam personagens diferentes, fontes de movimento diferentes, enquadramentos diferentes e durações diferentes. O carregamento do Wan-Animate-2 dura apenas cerca de 2.7 segundos e alterna as visualizações tão rapidamente que os defeitos temporais são difíceis de julgar. O clipe SCAIL-2 dura quase nove segundos e é muito mais fácil de inspecionar, mas “mais fácil de inspecionar” não é a mesma coisa que “melhor modelo”.
Uma comparação real precisa da mesma imagem de referência, condução de vídeo, resolução, contagem de fotogramas, hardware, política de propagação e pós-processamento. Em seguida, pontuaria a retenção de identidade, a estabilidade da mão, a recuperação da oclusão, a expressão facial, o movimento do tecido, a fuga de fundo e o tempo total de renderização. Qualquer coisa menos é uma comparação do carretel de demonstração.
O que eu realmente usaria após estes testes
Para a velocidade de iteração MiniMax H3, começaria por EasyCache + SageAttention. A lacuna nesta corrida é demasiado grande para ser ignorada. Eu ainda renderizaria um punhado de amostras correspondentes antes de aceitar a compensação de qualidade, porque a velocidade que danifica silenciosamente os rostos ou os movimentos não é velocidade – está apenas a gerar rejeições mais rapidamente.
eu trataria Espectro como a alternativa interessante e mais conservadora, e não a vencedora desta ronda de cronometragem. Merece um teste de qualidade controlado, sobretudo se o EasyCache começar a acumular erros visíveis numa tomada mais longa ou mais difícil.
Para o ajuste fino da comunidade NSFW H3, esperaria por um repositório estável, cartão de modelo, histórico de versões e amostras reproduzíveis. Um link desaparecido e um teaser tímido são suficientes para me deixar curioso. Não são suficientes para construir um fluxo de trabalho de produção.
Para Wan-Animate-2 versus SCAIL-2, executaria as minhas próprias entradas correspondentes. Ambos os projetos são suficientemente abertos para merecerem testes sérios. Os exemplos do artigo original simplesmente não respondem à questão.
Isto pode parecer menos entusiasmante do que “O Modelo A destrói o Modelo B”, mas é muito mais útil. Já existe certeza falsa suficiente no benchmarking de IA. Não temos de fabricar outro vencedor a partir de dois vídeos não relacionados.
Perguntas frequentes
O MiniMax H3 é oficialmente um modelo NSFW?
Não. O MiniMax H3 é um modelo multimodal de uso geral. A versão NSFW aqui discutida foi um ajuste fino da comunidade independente, não um lançamento oficial do MiniMax.
O EasyCache é sempre mais rápido que o Spectrum no MiniMax H3?
Não comprovado. EasyCache + SageAttention foi cerca de 2.3× mais rápido neste teste específico de 15 de segundo, 544 × 960. Diferente hardware, sementes, versões de nós e definições de qualidade podem alterar o resultado.
A demonstração pública do NSFW completou o prompt explícito completo?
O clipe publicado não mostra isso. Permanece vestido e termina como uma provocação, pelo que não pode verificar a sequência completa de despir descrita no prompt.
Wan-Animate-2 é melhor que SCAIL-2?
Os dois clipes de origem não são uma comparação controlada. Utilizam entradas e comprimentos diferentes, pelo que mostram que ambos os fluxos de trabalho são executados – e não qual é o melhor.
Porque é que o fluxo de trabalho Wan-Animate-2 utiliza quadros 81?
Este é o comprimento do pedaço utilizado no fluxo de trabalho demonstrado do ComfyUI. Em 24 fps, os alvos mais longos são divididos em vários pedaços de quadro 81 e depois montados.
De quanto hardware GPU necessita o Wan-Animate-2?
O projeto oficial documenta uma configuração 720p padrão em oito GPUs A800 e uma configuração 480p testada em dois A800s. Os nós comunitários e o descarregamento podem reduzir a necessidade, geralmente à custa da velocidade.
Estes modelos podem ser utilizados para conteúdo adulto?
A disponibilidade local não elimina os requisitos legais ou de consentimento. Utilize apenas personagens claramente adultas e imagens de referência, vozes e imagens de realização devidamente licenciadas. Não crie deepfakes íntimos de pessoas reais sem consentimento.