N NSFWAITool
简体中文

MiniMax H3 NSFW 实测:EasyCache 对比 Spectrum,以及 Wan-Animate-2 对比 SCAIL-2

MiniMax H3 加速与角色动画测试,对比 EasyCache、Spectrum、Wan-Animate-2 和 SCAIL-2

昨天,我刚测完一套 MiniMax H3 加速方案。今天,另一套又来了。

当然会这样。

这就是 2026 年的 ComfyUI:你的基准测试结果还没放凉,就有人发布了新节点,让整套测试看起来已经过时。昨天测试的是 EasyCache 加 SageAttention,今天新增的是 Spectrum,以及另一个在中文 ComfyUI 社区流传的加速插件。差不多同一时间,Wan-Animate-2 终于开源,也让我多了一个理由拿它和 SCAIL-2 做比较。

所以,原本的一项测试变成了三项:

  • 在 MiniMax H3 上比较 EasyCache + SageAttention 与 Spectrum;
  • 比较常规 H3 输出与社区制作的 NSFW 微调模型;
  • 比较 Wan-Animate-2 与 SCAIL-2 的角色动画效果。

先说结论:EasyCache 在耗时测试中遥遥领先;公开的 NSFW 视频所能证明的,远没有提示词声称的那么多;至于两段角色动画样片,测试条件远未达到可控比较的程度,根本不足以选出胜者。详细过程更有意思。

编者按:本文是在 微信公众号“赵KK搞AI”最初发布的实测笔记基础上改写成英文的版本,并非逐行翻译。第一人称测试结果和观点均保留自原作者;技术背景与注意事项已对照官方项目仓库核查。

先看速度测试:692 秒对 1,590 秒

两次 MiniMax H3 运行生成的都是 15 秒竖屏视频,分辨率为 544 × 960。EasyCache + SageAttention 工作流耗时 692.69 秒,约合 11 分 33 秒。Spectrum 耗时 1,590.15 秒,约合 26 分 30 秒

也就是说,在这次运行中,EasyCache + SageAttention 的速度大约快了 2.3 倍,等待时间缩短了略高于 56%。

MiniMax H3 配置 输出 实测耗时 相对结果
EasyCache + SageAttention 15 秒,544 × 960 692.69 秒 1.0×
Spectrum 15 秒,544 × 960 1,590.15 秒 耗时长 2.3 倍

英文 ComfyUI 界面显示 MiniMax H3 的 EasyCache 与 SageAttention 运行在 692.69 秒内完成

ComfyUI 中记录的 EasyCache + SageAttention 运行结果。图片来源:赵KK搞AI。

英文 ComfyUI 任务历史显示 Spectrum 耗时 1,590.15 秒,EasyCache 加 SageAttention 耗时 692.69 秒

两项任务记录的耗时。这张截图真正有用,因为有了它,我们就不必假装“感觉更快”也算基准测试。图片来源:赵KK搞AI。

加速测试对应的 15 秒 MiniMax H3 输出。视频来源:赵KK搞AI。

在有人把 2.3× 这个数字奉为普遍规律之前,先别急。原文没有提供完整的复现信息表,包括 GPU 型号、软件版本、种子、采样参数和各节点设置。这只是一次真实工作流的运行结果,不是经过同行评审的速度排行榜。

尽管如此,这么大的差距也绝非无关紧要。如果我唯一关心的是“在这台机器上,哪套方案能让我更快拿到下一版草稿?”,EasyCache + SageAttention 显然会是首选。

为什么 EasyCache 在这里更快

这两种加速器采用的并不是同一种方法。

EasyCache 更为激进。简单来说,它会尝试复用较早去噪步骤中的计算结果,而不是每一步都重新执行完整计算。只要生成过程保持稳定,就能节省大量算力。相应的风险也不难理解:一旦缓存估计开始偏移,误差就可能不断累积。

Spectrum 则更为克制。其 ComfyUI 实现使用特征预测——包括 Chebyshev 预测和岭回归——来推测 Transformer 的中间特征,再让模型继续细化结果。它不太像复印上一轮结果,更像是根据近期轨迹勾勒下一步,再交给模型整理完善。

这让 Spectrum 在技术上很有意思,但在这次特定测试中,它并不快。

改变的环节 EasyCache + SageAttention Spectrum
基本思路 复用此前的计算结果,并降低注意力计算成本 根据近期历史预测中间特征
性能提升来源 跳过更多重复计算 省去部分 Transformer 计算
可能的取舍 更容易出现误差累积和偏移 加速策略更保守
本次测试结果 692.69 秒 1,590.15 秒

目前缺少的是一组真正规范的视觉 A/B 测试:使用相同种子、相同源素材、相同提示词、相同采样设置,并提供两份完整质量的输出。没有这些条件,我只能告诉你哪次运行先完成,却无法诚实地判断哪种方法保留了更多细节。

这个区别很重要。我们在 NSFWAITool 评测方法中,也正是以此区分服务商宣称与可观察结果。秒表可以证明速度,却无法单独证明画质。

所谓“NSFW MiniMax H3 模型”需要加个星号

这里讨论的 NSFW 版本并非 MiniMax 官方发布MiniMax H3 官方仓库将其描述为通用多模态模型。面向成人内容的版本来自一名独立社区微调者,据称对方测试了五个版本。

链接很快就消失了,检查时已经返回 404。这固然令人烦恼,但在开源 AI 的这个领域也很常见:大多数人还没下载完,一个模型就可能已经被发布、镜像、改名或删除。如果一套生产工作流依赖某个未经验证的社区仓库永远在线,那么这套工作流实际上还不能算真正存在。

原始测试为基线使用了一段很长的多机位时尚类提示词,其中指定了 15 秒竖屏短片、多种镜头与角度,并要求不同剪辑间保持造型、音乐、灯光和人物身份一致。下面是常规 H3 的结果。

MiniMax H3 时尚类基线输出。画面中可见的“V”标记属于源视频的一部分,已原样保留。视频来源:赵KK搞AI。

成人内容测试保留了相同的多机位结构,但将服装变化过程改为明确的脱衣序列。这样的微调模型测试方式是合理的:保持镜头设计不变,只修改真正想测量的行为。

下面是原文收录的公开结果:

社区 NSFW 微调模型公开发布的预告片。原有中文字幕已替换为英文字幕;“V”标记仍属于源视频的一部分。视频来源:赵KK搞AI。

这里必须稍微戳破一下宣传效果:公开视频并没有展示提示词中描述的完整脱衣序列。人物始终穿着衣物,最后以一句近似“真想看的话,就自己试试吧”的挑逗性台词收尾。好笑吗?是的。能否证明模型完整实现了未经审查的行为?不能。

因此,我会把它视为一项证据:社区确实出现过 H3 的 NSFW 微调模型,而且它能生成连贯的成人主题预告片。但我不会用这段公开视频来证明它完成了所有明确指令。这是两种不同的主张,把它们混为一谈,正是 AI 演示逐渐变得荒谬的原因。

如果你正在比较托管式与本地成人视频方案,比起把希望全押在一个已经删除的仓库上,更适合从较全面的 AI 色情视频生成器目录入手。

Wan-Animate-2 开源了,所以没错,我也测了

Wan-Animate-2 于 2026 年 8 月发布了推理代码和模型权重。该项目使用源视频直接驱动参考角色,同时尽量保持身份、动作、表情和镜头行为的一致性。它是一套端到端系统,因此不需要在流程中间另设姿态提取器。

Wan-Animate-2 端到端角色动画流程的英文概览

原文收录的 Wan-Animate-2 流程概览。图片来源:赵KK搞AI;技术细节来源:Wan-Animate-2 项目。

先插一句,因为显然这件事仍有必要强调:Wan 3.0 没有开源。这确实令人失望,但这并不意味着针对开发者的匿名辱骂就显得聪明或有原则。你一边使用别人耗费数月构建的模型,一边又因为他们没有按你期望的时间表交出下一代模型,就表现得像遭到了私人背叛。如果你能自己做出 Wan 4.0,请尽管去做。我会第一个排队请你发布权重。

Wan-Animate-2 开源并不能神奇地平息围绕 Wan 3.0 的争论,但它仍是一次意义重大的发布。Wan 生态依然是少数几个让人们可以真正检查、修改模型,并将其接入私有 ComfyUI 流程的领域之一。对于成人项目来说,这一点更为重要,因为托管式产品可能完全不允许此类内容。我们更详细的 Wan 2.2 成人短片工作流解释了为什么当项目规模超过几段视频后,本地控制会成为制作层面的刚性需求。

Wan-Animate-2 的设置中有一步很容易漏掉

运行动画前,应先使用 LLM 描述参考图像。官方项目建议客观描述角色外观和背景,同时排除动作、主观判断与情绪揣测。

用自然语言来说,这项指令大致是:

只描述参考图像中实际可见的内容,包括主体的外观、服装、发型、配饰和背景。不要描述动作,也不要猜测其性格、情绪或意图。

这听起来有些吹毛求疵,但理解它的作用后就很合理了。驱动视频已经提供了动作。如果文本描述又凭空添加了另一个动作,就相当于让两位导演同时对模型喊出不同指令。

Wan-Animate-2 工作流在英文 ComfyUI 界面中运行

ComfyUI 中的 Wan-Animate-2。图片来源:赵KK搞AI。

另一个经常设置错误的参数是帧长度。以 24 fps 为例,计算很简单:

时长(秒)× 24 = 目标帧数

源资料中展示的工作流以 81 帧为一个分块,因此较长的视频需要运行多轮。

目标时长 24 fps 下的帧数 所需 81 帧分块数
3 秒 72 1
5 秒 120 2
8 秒 192 3
10 秒 240 3
15 秒 360 5
30 秒 720 9

英文 Wan-Animate-2 ComfyUI 节点将帧长度设置为 81

该工作流采用的 81 帧长度设置。图片来源:赵KK搞AI。

官方仓库默认的 720p 配置针对 8 张 A800 GPU 调优,另有一套在 2 张 A800 上测试过的 480p 配置。这可不是什么适合在笔记本电脑上轻松“点击 Queue Prompt”就能运行的小需求。社区优化会继续降低显存门槛,但凡有人把本地角色动画描述成不需要成本的事情,那他显然从未在真实工作流中看着进度条缓慢爬行。

Wan-Animate-2 对比 SCAIL-2:这些视频不足以分出胜负

SCAIL-2 项目采用了类似的端到端路线。它绕过中间姿态表示,并加入掩码语义与多参考条件控制。其官方版本支持 512p 和 704p 工作流,项目方建议在 704p 下使用姿态驱动变体。

下面是原文保留的 Wan-Animate-2 样片:

Wan-Animate-2 样片。源文件会在驱动/参考画面与生成角色之间快速交替,此处未经改动,按原样呈现。视频来源:赵KK搞AI。

下面是 SCAIL-2 样片:

SCAIL-2 角色动画样片。视频来源:赵KK搞AI。

我不会仅凭这两段视频就宣布胜者,因为那只是在制造虚假的精确性。两者使用了不同角色、不同动作源、不同构图和不同时长。Wan-Animate-2 上传的视频只有大约 2.7 秒,而且画面切换速度很快,很难判断时序缺陷。SCAIL-2 视频接近 9 秒,更便于观察,但“更容易观察”并不等于“模型更好”。

真正的比较需要使用相同的参考图像、驱动视频、分辨率、帧数、硬件、种子策略和后期处理。之后,我会对身份保持、手部稳定性、遮挡恢复、面部表情、布料运动、背景泄漏和总渲染时间进行评分。低于这个标准,就只能算样片比较。

完成这些测试后,我实际会怎么选

如果关注 MiniMax H3 的迭代速度,我会先用 EasyCache + SageAttention。这次运行中的差距大得无法忽视。不过,在接受其画质取舍前,我仍会渲染几组条件一致的样片,因为如果提速会悄悄损伤人脸或动作,那就不是真正的提速——只是更快地产出废片。

我会把 Spectrum 视为一个有趣且更保守的备选方案,而不是本轮耗时测试的胜者。它值得接受受控画质测试,尤其是在更长或更困难的镜头中,如果 EasyCache 开始累积可见误差,更应如此。

对于社区 NSFW H3 微调模型,我会等待稳定的仓库、模型卡、版本历史和可复现样片。一个消失的链接加上一段欲言又止的预告片,足以让我产生兴趣,却不足以让我围绕它搭建生产工作流。

至于 Wan-Animate-2 与 SCAIL-2,我会亲自使用条件一致的输入进行测试。这两个项目的开放程度都值得认真评估,但原文中的样片根本无法回答谁更好的问题。

这听起来可能不如“模型 A 碾压模型 B”那么刺激,但实用得多。AI 基准测试中已经充斥着虚假的确定性,我们没必要再根据两段毫不相关的视频硬造一个冠军。

常见问题

MiniMax H3 官方定位是 NSFW 模型吗?

不是。MiniMax H3 是通用多模态模型。这里讨论的 NSFW 版本是独立社区微调模型,并非 MiniMax 官方发布。

在 MiniMax H3 上,EasyCache 是否总比 Spectrum 快?

尚未得到证明。在这次特定的 15 秒、544 × 960 测试中,EasyCache + SageAttention 的速度大约快了 2.3 倍。硬件、种子、节点版本和画质设置不同,都可能改变结果。

公开的 NSFW 演示是否完整执行了明确的成人内容提示词?

公开视频没有展示这一点。人物始终穿着衣物,视频也以预告形式收尾,因此无法验证提示词中描述的完整脱衣序列。

Wan-Animate-2 比 SCAIL-2 更好吗?

两段源视频并不构成受控比较。它们使用了不同的输入和时长,因此只能说明两套工作流都能运行,无法说明哪一个更好。

为什么 Wan-Animate-2 工作流使用 81 帧?

这是演示中的 ComfyUI 工作流所采用的分块长度。在 24 fps 下,时长更长的目标会拆分为多个 81 帧分块,之后再组装起来。

Wan-Animate-2 需要多少 GPU 硬件?

官方项目记录的默认 720p 配置使用 8 张 A800 GPU,经过测试的 480p 配置则使用 2 张 A800。社区节点和卸载技术可能降低硬件要求,但通常会以速度为代价。

这些模型可以用于成人内容吗?

能够在本地使用,并不意味着可以忽视法律或同意要求。只能使用明确为成年人的角色,以及获得适当授权的参考图像、声音和驱动视频素材。不得在未经同意的情况下制作真实人物的私密深度伪造内容。