N NSFWAITool
繁體中文

MiniMax H3 NSFW 實測:EasyCache 對比 Spectrum,以及 Wan-Animate-2 對比 SCAIL-2

MiniMax H3 加速與角色動畫測試,對比 EasyCache、Spectrum、Wan-Animate-2 和 SCAIL-2

昨天,我剛測完一套 MiniMax H3 加速方案。今天,另一套又來了。

當然會這樣。

這就是 2026 年的 ComfyUI:你的基準測試結果還沒放涼,就有人發布了新節點,讓整套測試看起來已經過時。昨天測試的是 EasyCache 加 SageAttention,今天新增的是 Spectrum,以及另一個在中文 ComfyUI 社區流傳的加速外掛程式。差不多同一時間,Wan-Animate-2 終于開源,也讓我多了一個理由拿它和 SCAIL-2 做比較。

所以,原本的一項測試變成了三項:

  • 在 MiniMax H3 上比較 EasyCache + SageAttention 與 Spectrum;
  • 比較常規 H3 輸出與社區製作的 NSFW 微調模型;
  • 比較 Wan-Animate-2 與 SCAIL-2 的角色動畫效果。

先說結論:EasyCache 在耗時測試中遙遙領先;公開的 NSFW 影片所能證明的,遠沒有提示詞聲稱的那么多;至于兩段角色動畫樣片,測試條件遠未達到可控比較的程度,根本不足以選出勝者。詳細過程更有意思。

編者按:本文是在 微信公眾號“趙KK搞AI”最初發布的實測筆記基礎上改寫成英文的版本,並非逐行翻譯。第一人稱測試結果和觀點均保留自原作者;技術背景與注意事項已對照官方項目倉庫核查。

先看速度測試:692 秒對 1,590 秒

兩次 MiniMax H3 運行生成的都是 15 秒豎屏影片,解析度為 544 × 960。EasyCache + SageAttention 工作流程耗時 692.69 秒,約合 11 分 33 秒。Spectrum 耗時 1,590.15 秒,約合 26 分 30 秒

也就是說,在這次運行中,EasyCache + SageAttention 的速度大約快了 2.3 倍,等待時間縮短了略高于 56%。

MiniMax H3 配置 輸出 實測耗時 相對結果
EasyCache + SageAttention 15 秒,544 × 960 692.69 秒 1.0×
Spectrum 15 秒,544 × 960 1,590.15 秒 耗時長 2.3 倍

英文 ComfyUI 界面顯示 MiniMax H3 的 EasyCache 與 SageAttention 運行在 692.69 秒內完成

ComfyUI 中記錄的 EasyCache + SageAttention 運行結果。圖片來源:趙KK搞AI。

英文 ComfyUI 任務歷史顯示 Spectrum 耗時 1,590.15 秒,EasyCache 加 SageAttention 耗時 692.69 秒

兩項任務記錄的耗時。這張截圖真正有用,因為有了它,我們就不必假裝“感覺更快”也算基準測試。圖片來源:趙KK搞AI。

加速測試對應的 15 秒 MiniMax H3 輸出。影片來源:趙KK搞AI。

在有人把 2.3× 這個數字奉為普遍規律之前,先別急。原文沒有提供完整的復現資訊表,包括 GPU 型號、軟體版本、種子、取樣參數和各節點設定。這只是一次真實工作流程的運行結果,不是經過同行評審的速度排行榜。

儘管如此,這麼大的差距也絕非無關緊要。如果我唯一關心的是“在這臺機器上,哪套方案能讓我更快拿到下一版草稿?”,EasyCache + SageAttention 顯然會是首選。

為什麼 EasyCache 在這里更快

這兩種加速器采用的並不是同一種方法。

EasyCache 更為激進。簡單來說,它會嘗試復用較早去噪步驟中的計算結果,而不是每一步都重新執行完整計算。只要生成過程保持穩定,就能節省大量算力。相應的風險也不難理解:一旦快取估計開始偏移,誤差就可能不斷累積。

Spectrum 則更為克制。其 ComfyUI 實現使用特征預測——包括 Chebyshev 預測和嶺回歸——來推測 Transformer 的中間特征,再讓模型繼續細化結果。它不太像復印上一輪結果,更像是根據近期軌跡勾勒下一步,再交給模型整理完善。

這讓 Spectrum 在技術上很有意思,但在這次特定測試中,它並不快。

改變的環節 EasyCache + SageAttention Spectrum
基本思路 復用此前的計算結果,並降低注意力計算成本 根據近期歷史預測中間特征
性能提升來源 跳過更多重復計算 省去部分 Transformer 計算
可能的取舍 更容易出現誤差累積和偏移 加速策略更保守
本次測試結果 692.69 秒 1,590.15 秒

目前缺少的是一組真正規范的視覺 A/B 測試:使用相同種子、相同源素材、相同提示詞、相同取樣設定,並提供兩份完整品質的輸出。沒有這些條件,我只能告訴你哪次運行先完成,卻無法誠實地判斷哪種方法保留了更多細節。

這個區別很重要。我們在 NSFWAITool 評測方法中,也正是以此區分服務商宣稱與可觀察結果。秒表可以證明速度,卻無法單獨證明畫質。

所謂“NSFW MiniMax H3 模型”需要加個星號

這里討論的 NSFW 版本並非 MiniMax 官方發布MiniMax H3 官方倉庫將其描述為通用多模態模型。面向成人內容的版本來自一名獨立社區微調者,據稱對方測試了五個版本。

連結很快就消失了,檢查時已經返回 404。這固然令人煩惱,但在開源 AI 的這個領域也很常見:大多數人還沒下載完,一個模型就可能已經被發布、鏡像、改名或刪除。如果一套生產工作流程依賴某個未經驗證的社區倉庫永遠線上,那么這套工作流程實際上還不能算真正存在。

原始測試為基線使用了一段很長的多機位時尚類提示詞,其中指定了 15 秒豎屏短片、多種鏡頭與角度,並要求不同剪輯間保持造型、音樂、燈光和人物身份一致。下面是常規 H3 的結果。

MiniMax H3 時尚類基線輸出。畫面中可見的“V”標記屬于源影片的一部分,已原樣保留。影片來源:趙KK搞AI。

成人內容測試保留了相同的多機位結構,但將服裝變化過程改為明確的脫衣序列。這樣的微調模型測試方式是合理的:保持鏡頭設計不變,只修改真正想測量的行為。

下面是原文收錄的公開結果:

社區 NSFW 微調模型公開發布的預告片。原有中文字幕已替換為英文字幕;“V”標記仍屬于源影片的一部分。影片來源:趙KK搞AI。

這里必須稍微戳破一下宣傳效果:公開影片並沒有展示提示詞中描述的完整脫衣序列。人物始終穿著衣物,最后以一句近似“真想看的話,就自己試試吧”的挑逗性臺詞收尾。好笑嗎?是的。能否證明模型完整實現了未經審查的行為?不能。

因此,我會把它視為一項證據:社區確實出現過 H3 的 NSFW 微調模型,而且它能生成連貫的成人主題預告片。但我不會用這段公開影片來證明它完成了所有明確指令。這是兩種不同的主張,把它們混為一談,正是 AI 演示逐漸變得荒謬的原因。

如果你正在比較托管式與本機成人影片方案,比起把希望全押在一個已經刪除的倉庫上,更適合從較全面的 AI 色情影片生成器目錄入手。

Wan-Animate-2 開源了,所以沒錯,我也測了

Wan-Animate-2 于 2026 年 8 月發布了推理程式碼和模型權重。該項目使用源影片直接驅動參考角色,同時盡量保持身份、動作、表情和鏡頭行為的一致性。它是一套端到端系統,因此不需要在流程中間另設姿態提取器。

Wan-Animate-2 端到端角色動畫流程的英文概覽

原文收錄的 Wan-Animate-2 流程概覽。圖片來源:趙KK搞AI;技術細節來源:Wan-Animate-2 項目。

先插一句,因為顯然這件事仍有必要強調:Wan 3.0 沒有開源。這確實令人失望,但這並不意味著針對開發者的匿名辱罵就顯得聰明或有原則。你一邊使用別人耗費數月構建的模型,一邊又因為他們沒有按你期望的時間表交出下一代模型,就表現得像遭到了私人背叛。如果你能自己做出 Wan 4.0,請儘管去做。我會第一個排隊請你發布權重。

Wan-Animate-2 開源並不能神奇地平息圍繞 Wan 3.0 的爭論,但它仍是一次意義重大的發布。Wan 生態依然是少數幾個讓人們可以真正檢查、修改模型,並將其接入私有 ComfyUI 流程的領域之一。對於成人項目來說,這一點更為重要,因為托管式產品可能完全不允許此類內容。我們更詳細的 Wan 2.2 成人短片工作流程解釋了為什麼當項目規模超過幾段影片后,本機控制會成為製作層面的剛性需求。

Wan-Animate-2 的設定中有一步很容易漏掉

運行動畫前,應先使用 LLM 描述參考影像。官方項目建議客觀描述角色外觀和背景,同時排除動作、主觀判斷與情緒揣測。

用自然語言來說,這項指令大致是:

只描述參考影像中實際可見的內容,包括主體的外觀、服裝、發型、配飾和背景。不要描述動作,也不要猜測其性格、情緒或意圖。

這聽起來有些吹毛求疵,但理解它的作用后就很合理了。驅動影片已經提供了動作。如果文本描述又憑空添加了另一個動作,就相當于讓兩位導演同時對模型喊出不同指令。

Wan-Animate-2 工作流程在英文 ComfyUI 界面中運行

ComfyUI 中的 Wan-Animate-2。圖片來源:趙KK搞AI。

另一個經常設定錯誤的參數是影格長度。以 24 fps 為例,計算很簡單:

時長(秒)× 24 = 目標影格數

源資料中展示的工作流程以 81 影格為一個分塊,因此較長的影片需要運行多輪。

目標時長 24 fps 下的影格數 所需 81 影格分塊數
3 秒 72 1
5 秒 120 2
8 秒 192 3
10 秒 240 3
15 秒 360 5
30 秒 720 9

英文 Wan-Animate-2 ComfyUI 節點將影格長度設定為 81

該工作流程采用的 81 影格長度設定。圖片來源:趙KK搞AI。

官方倉庫預設的 720p 配置針對 8 張 A800 GPU 調優,另有一套在 2 張 A800 上測試過的 480p 配置。這可不是什麼適合在筆記本電腦上輕松“點擊 Queue Prompt”就能運行的小需求。社區最佳化會繼續降低顯示記憶體門檻,但凡有人把本機角色動畫描述成不需要成本的事情,那他顯然從未在真實工作流程中看著進度條緩慢爬行。

Wan-Animate-2 對比 SCAIL-2:這些影片不足以分出勝負

SCAIL-2 項目采用了類似的端到端路線。它繞過中間姿態表示,並加入掩碼語義與多參考條件控制。其官方版本支援 512p 和 704p 工作流程,項目方建議在 704p 下使用姿態驅動變體。

下面是原文保留的 Wan-Animate-2 樣片:

Wan-Animate-2 樣片。來源檔案會在驅動/參考畫面與生成角色之間快速交替,此處未經改動,按原樣呈現。影片來源:趙KK搞AI。

下面是 SCAIL-2 樣片:

SCAIL-2 角色動畫樣片。影片來源:趙KK搞AI。

我不會僅憑這兩段影片就宣布勝者,因為那只是在制造虛假的精確性。兩者使用了不同角色、不同動作源、不同構圖和不同時長。Wan-Animate-2 上傳的影片只有大約 2.7 秒,而且畫面切換速度很快,很難判斷時序缺陷。SCAIL-2 影片接近 9 秒,更便于觀察,但“更容易觀察”並不等于“模型更好”。

真正的比較需要使用相同的參考影像、驅動影片、解析度、影格數、硬體、種子策略和后期處理。之後,我會對身份保持、手部穩定性、遮擋恢復、面部表情、布料運動、背景泄漏和總渲染時間進行評分。低于這個標準,就只能算樣片比較。

完成這些測試后,我實際會怎麼選

如果關注 MiniMax H3 的迭代速度,我會先用 EasyCache + SageAttention。這次運行中的差距大得無法忽視。不過,在接受其畫質取舍前,我仍會渲染幾組條件一致的樣片,因為如果提速會悄悄損傷人臉或動作,那就不是真正的提速——只是更快地產出廢片。

我會把 Spectrum 視為一個有趣且更保守的備選方案,而不是本輪耗時測試的勝者。它值得接受受控畫質測試,尤其是在更長或更困難的鏡頭中,如果 EasyCache 開始累積可見誤差,更應如此。

對於社區 NSFW H3 微調模型,我會等待穩定的倉庫、模型卡、版本歷史和可復現樣片。一個消失的連結加上一段欲言又止的預告片,足以讓我產生興趣,卻不足以讓我圍繞它搭建生產工作流程。

至于 Wan-Animate-2 與 SCAIL-2,我會親自使用條件一致的輸入進行測試。這兩個項目的開放程度都值得認真評估,但原文中的樣片根本無法回答誰更好的問題。

這聽起來可能不如“模型 A 碾壓模型 B”那么刺激,但實用得多。AI 基準測試中已經充斥著虛假的確定性,我們沒必要再根據兩段毫不相關的影片硬造一個冠軍。

常見問題

MiniMax H3 官方定位是 NSFW 模型嗎?

不是。MiniMax H3 是通用多模態模型。這里討論的 NSFW 版本是獨立社區微調模型,並非 MiniMax 官方發布。

在 MiniMax H3 上,EasyCache 是否總比 Spectrum 快?

尚未得到證明。在這次特定的 15 秒、544 × 960 測試中,EasyCache + SageAttention 的速度大約快了 2.3 倍。硬體、種子、節點版本和畫質設定不同,都可能改變結果。

公開的 NSFW 演示是否完整執行了明確的成人內容提示詞?

公開影片沒有展示這一點。人物始終穿著衣物,影片也以預告形式收尾,因此無法驗證提示詞中描述的完整脫衣序列。

Wan-Animate-2 比 SCAIL-2 更好嗎?

兩段源影片並不構成受控比較。它們使用了不同的輸入和時長,因此只能說明兩套工作流程都能運行,無法說明哪一個更好。

為什麼 Wan-Animate-2 工作流程使用 81 影格?

這是演示中的 ComfyUI 工作流程所采用的分塊長度。在 24 fps 下,時長更長的目標會拆分為多個 81 影格分塊,之後再組裝起來。

Wan-Animate-2 需要多少 GPU 硬體?

官方項目記錄的預設 720p 配置使用 8 張 A800 GPU,經過測試的 480p 配置則使用 2 張 A800。社區節點和解除安裝技術可能降低硬體要求,但通常會以速度為代價。

這些模型可以用於成人內容嗎?

能夠在本機使用,並不意味著可以忽視法律或同意要求。只能使用明確為成年人的角色,以及獲得適當授權的參考影像、聲音和驅動影片素材。不得在未經同意的情況下製作真實人物的私密深度偽造內容。