어제 나는 하나의 MiniMax H3 가속 설정 테스트를 마쳤다. 오늘 또 다른 하나가 도착했다.
물론 그랬어요.
그것이 2026년의 ComfyUI입니다: 벤치마크가 겨우 끝나기도 전에 누군가가 새 노드를 출시하여 전체 시스템이 구식처럼 느껴지게 만듭니다. 어제의 설정은 EasyCache와 SageAttention이었습니다. 오늘 추가된 것은 Spectrum과 중국 ComfyUI 커뮤니티에서 돌고 있는 또 다른 속도 플러그인이었습니다. 거의 동시에 Wan-Animate-2가 마침내 오픈 소스가 되었고, 덕분에 SCAIL-2와 비교할 또 한 가지 이유가 생겼습니다.
그래서 이것은 하나의 테스트가 아니라 세 개의 테스트로 바뀌었다:
- EasyCache MiniMax H3에서 SageAttention 대 Spectrum;
- 일반 H3 출력과 커뮤니티 제작 NSFW 파인튜닝 비교;
- 캐릭터 애니메이션을 위한 Wan-Animate-2 대 SCAIL-2.
짧게 말하면: EasyCache가 타이밍 테스트에서 압도적으로 이겼고, 공개된 NSFW 클립은 프롬프트에서 주장하는 것보다 효과가 덜하며, 두 개의 캐릭터 애니메이션 샘플은 승자를 정할 만큼 충분히 제어되지 않았다. 더 긴 버전이 더 흥미롭다.
편집자 주: 이것은 원래 출판된 실습 노트의 원어민 영어 버전입니다 조KK가 위챗에서 AI를 한다, 한 줄씩 번역한 것이 아님. 1인칭 테스트 결과와 의견은 원저자의 내용을 유지하며, 기술적 맥락과 주의사항은 공식 프로젝트 저장소를 기준으로 확인함.
먼저, 속도 테스트: 692초 대 1,590초
두 MiniMax H3 실행 모두 544 × 960 해상도로 15초 길이의 세로 클립을 생성했습니다. EasyCache SageAttention 워크플로가 완료되었습니다. 692.69초, 혹은 약 11분 33초. 스펙트럼이 가져갔다 1,590.15초, 혹은 약 26분 30초.
그것은 EasyCache SageAttention을 대략적으로 만든다 이번 실행에서 2.3배 빠름. 대기 시간을 56% 이상 단축했습니다.
| MiniMax H3 설정 | 출력 | 측정된 시간 | 상대적 결과 |
|---|---|---|---|
| EasyCache 세이지어텐션 | 15초, 544 × 960 | 692.69초 | 1.0배 |
| 스펙트럼 | 15초, 544 × 960 | 1,590.15초 | 2.3배 더 긴 |

ComfyUI에 기록된 EasyCache + SageAttention 실행 결과. 원본 이미지: 赵KK搞AI.

기록된 두 번의 작업 시간. 이것이 유용한 스크린샷입니다; 이것 덕분에 우리가 '더 빨리 느껴졌다'는 것을 기준으로 가장하는 것을 피할 수 있습니다. 원본 이미지: 赵KK搞AI.
가속도 테스트에 첨부된 15초 미니맥스 H3 출력. 원본 영상: 赵KK搞AI.
누군가 그 2.3× 수치를 보편적인 법칙으로 바꾸기 전에: 그러지 마세요. 이 글은 GPU 모델, 소프트웨어 버전, 시드, 샘플링 파라미터, 노드별 설정이 포함된 완전한 재현성 시트를 제공하지 않습니다. 이것은 한 가지 실제 워크플로우 결과일 뿐, 동료 검토를 거친 속도 순위표가 아닙니다.
그럼에도 불구하고, 이렇게 큰 차이는 무시할 수 없습니다. 만약 제 유일한 질문이 '이 기계에서 어느 설정이 더 빨리 또 다른 초안을 가져올 수 있을까?'라면, EasyCache SageAttention이 명백한 첫 번째 선택이 될 것입니다.
왜 여기서 EasyCache가 더 빨랐는가
그 두 가속기는 같은 트릭을 하고 있는 것이 아니다.
이지캐시는 더 적극적인 접근 방식입니다. 쉽게 말하면, 매번 전체 계산을 다시 수행하는 대신 이전 디노이징 단계의 작업을 재사용하려고 합니다. 생성이 안정적일 때, 이것은 많은 계산을 절약할 수 있습니다. 위험도 이해하기 쉽습니다. 캐시된 추정치가 점점 벗어나기 시작하면, 오류가 누적될 수 있습니다.
스펙트럼 더 절제되어 있습니다. ComfyUI 구현에서는 특징 예측—체비셰프 예측과 능선 회귀—을 사용하여 중간 트랜스포머 특징을 예측한 다음, 모델이 결과를 계속 다듬도록 합니다. 이는 이전 과정을 복사하는 것보다는 최근 경로를 기반으로 다음 단계를 스케치한 후 모델이 이를 정리하는 것과 더 비슷합니다.
그것이 스펙트럼을 기술적으로 흥미롭게 만듭니다. 그러나 이 특정 테스트에서는 빠르게 만들지는 못했습니다.
| 그것이 바꾸는 것 | EasyCache 세이지어텐션 | 스펙트럼 |
|---|---|---|
| 기본 아이디어 | 이전 계산을 재사용하고 주의 비용을 줄인다 | 최근 기록에서 중간 기능을 예측하다 |
| 이익이 어디에서 오는가 | 반복 작업 더 건너뛰기 | 일부 트랜스포머 계산 피하기 |
| 가능한 절충 | 누적된 편차에 대한 더 많은 기회 | 보다 보수적인 가속 |
| 이 테스트의 결과 | 692.69초 | 1,590.15초 |
부족한 것은 적절한 시각적 A/B 비교입니다: 동일한 시드, 동일한 소스, 동일한 프롬프트, 동일한 샘플링 설정, 두 출력물 모두 전체 품질로 제공되어야 합니다. 그것이 없으면, 어떤 실행이 먼저 완료되었는지는 말할 수 있습니다. 어떤 방법이 더 많은 세부 사항을 보존했는지는 솔직히 말할 수 없습니다.
그 구분은 중요합니다. 또한 그것이 우리가 제공자의 주장과 관찰 가능한 결과를 구분하려고 하는 방식이기도 합니다. NSFWA 도구 검토 방법론. 스톱워치는 속도를 증명할 수 있습니다. 혼자서는 이미지 품질을 증명할 수 없습니다.
“NSFW MiniMax H3 모델”에는 별표가 필요합니다
여기서 논의된 NSFW 버전은 공식 MiniMax 출시가 아님. 그 공식 MiniMax H3 저장소 일반 목적의 멀티모달 모델을 설명합니다. 성인용 버전은 독립 커뮤니티 파인튜너로부터 나온 것이며, 그는 보고에 따르면 다섯 가지 버전을 테스트했다고 합니다.
링크가 금세 사라졌고 확인해 보니 이미 404를 반환하고 있었습니다. 이는 짜증나지만, 오픈 소스 AI의 이 영역에서는 정상적인 일입니다. 모델은 대부분의 사람들이 다운로드를 마치기 전에 출시되거나, 미러링되거나, 이름이 바뀌거나, 삭제될 수 있습니다. 한 생산 워크플로가 검증되지 않은 커뮤니티 저장소 하나가 영원히 온라인 상태를 유지하는 것에 의존한다면, 그 워크플로는 아직 실제로 존재하지 않는 것입니다.
원래 테스트에서는 기준선(baseline)을 위해 길고 다중 카메라 패션 프롬프트를 사용했습니다. 여기에는 세로 15초 릴, 여러 렌즈와 각도, 일관된 스타일링, 음악, 조명, 컷 간 정체성이 지정되었습니다. 일반 H3 결과는 아래에 있습니다.
기준선 MiniMax H3 패션 출력. 보이는 'V' 표시는 원본 클립의 일부이며 유지되었습니다. 원본 영상: 赵KK搞AI.
성인 테스트의 경우, 프롬프트는 동일한 다중 카메라 구조를 유지하되 의상 진행을 명시적인 탈의 시퀀스로 변경했습니다. 이는 세부 조정을 테스트하는 합리적인 방법입니다: 샷 디자인을 유지하고 실제로 측정하고자 하는 행동을 변경하는 것입니다.
다음은 원래 기사에 포함된 공개 결과입니다:
커뮤니티 NSFW 파인튜닝용 공개 티저를 게시했습니다. 원래 중국어 자막은 영어 자막으로 대체되었으며, 'V' 표시가 원본 영상의 일부로 남아 있습니다. 원본 영상: 赵KK搞AI.
그리고 여기서 나는 마케팅을 조금 망쳐야 합니다: 공개 영상에는 프롬프트에 설명된 전체 탈의 과정이 나타나지 않습니다. 그것은 옷을 입은 채로 유지되며, 결국 '정말로 보고 싶다면 스스로 해보라'는 농담 섞인 한 줄로 끝난다. 웃긴가? 예. 완전히 검열되지 않은 행동의 증거인가? 아니오.
그래서 나는 이것을 커뮤니티 NSFW H3 파인튜닝이 존재했고 일관된 성인 테마 티저를 생성할 수 있었다는 증거로 간주할 것이다. 나는 공개 클립을 그것이 모든 명시적 지침을 완료했다는 증거로 사용하지 않을 것이다. 이 두 가지는 서로 다른 주장이고, 이를 합쳐버리는 것이 AI 데모가 터무니없는 것으로 변하는 방식이다.
호스팅된 성인 비디오 옵션과 로컬 성인 비디오 옵션을 비교하고 있다면, 더 넓은 AI 포르노 비디오 생성기 디렉토리 삭제된 저장소에 모든 것을 걸기보다는 더 나은 출발점입니다.
Wan-Animate-2가 오픈 소스로 공개되어서, 네, 저도 그것을 테스트해봤어요
완-애니메이트-2 2026년 8월에 추론 코드와 모델 가중치를 공개했습니다. 이 프로젝트는 원본 비디오에서 레퍼런스 캐릭터를 직접 구동하면서 정체성, 움직임, 표정, 카메라 동작을 유지하려고 합니다. 이는 엔드-투-엔드 시스템이므로 파이프라인 중간에 별도의 포즈 추출기가 필요하지 않습니다.

원-애니메이트-2 파이프라인 개요는 원래 기사에 포함되어 있습니다. 출처 이미지: 赵KK搞AI; 기술 세부 정보: 원-애니메이트-2 프로젝트.
잠깐 다른 얘기를 하자면, 아직도 말해야 하는 것 같아서 하는 말입니다: Wan 3.0은 오픈 소스가 아닙니다. 실망스럽습니다. 이것이 개발자를 대상으로 한 익명적 학대를 영리하거나 원칙 있는 행동으로 만드는 것은 아닙니다. 당신은 다른 사람들이 몇 달 동안 만든 모델을 사용한 후, 그들이 당신이 원하는 일정에 맞춰 다음 버전을 제공하지 않았다고 개인적으로 배신감을 느끼고 있는 것입니다. 만약 스스로 Wan 4.0을 만들 수 있다면, 제발 만들어 주세요. 저는 당신이 가중치를 공개하도록 요청할 첫 번째 사람이 될 것입니다.
Wan-Animate-2가 오픈 소스로 공개되었다고 해서 Wan 3.0 논쟁이 마법처럼 해결되는 것은 아니지만, 여전히 의미 있는 출시입니다. Wan 생태계는 사람들이 실제로 모델을 검사하고 수정하며 개인 ComfyUI 파이프라인에 연결할 수 있는 몇 안 되는 장소 중 하나로 남아 있습니다. 이는 호스팅된 제품에서 해당 자료를 전혀 허용하지 않을 수 있는 성인 프로젝트에서는 더욱 중요합니다. 우리의 더 긴 Wan 2.2 성인 단편 영화 작업 흐름 프로젝트가 몇 개의 클립을 넘어 성장하면 로컬 제어가 생산 요구 사항이 되는 이유를 설명합니다.
Wan-Animate-2 설정에는 쉽게 놓칠 수 있는 단계가 하나 있습니다
애니메이션을 실행하기 전에 참조 이미지는 LLM으로 설명되어야 합니다. 공식 프로젝트는 행동, 주관적 판단, 감정적 추측을 제외하고 캐릭터의 외모와 배경에 대한 객관적인 설명을 권장합니다.
자연스러운 영어로, 지침은 기본적으로 다음과 같습니다:
참조 이미지에 시각적으로 나타난 것만 설명하세요. 대상의 외모, 옷차림, 머리 모양, 액세서리, 배경을 다루세요. 행동은 설명하지 마세요. 성격, 기분, 의도는 추측하지 마세요.
왜 그것이 도움이 되는지 보기 전까지는 까다롭게 들립니다. 운전 영상은 이미 행동을 제공합니다. 만약 글 설명이 다른 행동을 만들어낸다면, 모델에게 서로 다른 지시를 외치는 두 감독을 준 셈이 됩니다.

ComfyUI의 Wan-Animate-2. 원본 이미지: 赵KK搞AI.
사람들이 잘못 이해하는 또 다른 설정은 프레임 길이입니다. 24fps에서는 계산이 단순합니다:
초 단위 지속 시간 × 24 = 목표 프레임 수
소스에 표시된 워크플로우는 81프레임 단위를 사용하므로, 더 긴 클립은 여러 번 처리해야 합니다.
| 목표 지속 시간 | 24fps의 프레임 | 81프레임 단위 필요 |
|---|---|---|
| 3초 | 72 | 1 |
| 5초 | 120 | 2 |
| 8초 | 192 | 3 |
| 10초 | 240 | 3 |
| 15초 | 360 | 5 |
| 30초 | 720 | 9 |

워크플로우에서 사용된 81프레임 길이 설정. 원본 이미지: 赵KK搞AI.
공식 저장소의 기본 720p 설정은 8개의 A800 GPU에 맞춰 조정되어 있으며, 2개의 A800에서 테스트된 480p 구성도 있습니다. 이는 친근한 '내 노트북에서 큐 프롬프트 클릭' 요구 사항이 아닙니다. 커뮤니티 최적화는 계속해서 메모리 최저치를 낮출 것이지만, 마치 로컬 캐릭터 애니메이션이 무료인 것처럼 글을 쓰는 사람은 실제 워크플로우에서 진행 상황 표시줄이 천천히 움직이는 것을 본 적이 없는 것이 분명합니다.
Wan-Animate-2 대 SCAIL-2: 클립들은 승자를 증명하지 않는다
그 SCAIL-2 이 프로젝트는 유사한 종단 간 경로를 따릅니다. 중간 포즈 표현을 피하고 마스크 의미론과 다중 참조 조건을 추가합니다. 공식 릴리스는 512p 및 704p 워크플로를 지원하며, 프로젝트에서는 704p에서 포즈 기반 변형을 권장합니다.
다음은 원본 기사에서 보존된 Wan-Animate-2 샘플입니다:
Wan-Animate-2 샘플. 원본 파일은 구동/참조 뷰와 생성된 캐릭터를 빠르게 교대로 보여주며; 여기서는 변경 없이 재현되었습니다. 원본 비디오: 赵KK搞AI.
그리고 여기 SCAIL-2 샘플이 있습니다:
SCAIL-2 캐릭터 애니메이션 샘플. 원본 영상: 赵KK搞AI.
저는 이 두 클립 중에서 우승자를 발표하지 않겠습니다. 그것은 거짓 정밀도가 되기 때문입니다. 이들은 서로 다른 캐릭터, 서로 다른 모션 소스, 서로 다른 프레이밍, 서로 다른 지속 시간을 사용합니다. Wan-Animate-2 업로드는 약 2.7초 정도이며, 시점을 매우 빠르게 교대로 보여주기 때문에 시간적 결함을 판단하기 어렵습니다. SCAIL-2 클립은 거의 9초 동안 실행되며 훨씬 쉽게 검사할 수 있지만, '검사가 쉽다'고 해서 '모델이 더 낫다'는 것은 아닙니다.
진정한 비교를 위해서는 동일한 참조 이미지, 구동 비디오, 해상도, 프레임 수, 하드웨어, 시드 정책, 후처리가 필요합니다. 그 다음에 정체성 유지, 손의 안정성, 폐색 복구, 얼굴 표정, 의류 움직임, 배경 누출, 총 렌더링 시간을 평가할 것입니다. 그보다 적은 것은 데모 릴 비교에 불과합니다.
이 테스트들 후에 실제로 제가 사용할 것
MiniMax H3 반복 속도를 위해, 나는 다음부터 시작하겠다 EasyCache 세이지어텐션. 이 실행에서의 간격은 무시하기에는 너무 큽니다. 품질 손실을 받아들이기 전에 여전히 몇 개의 일치하는 샘플을 렌더링할 것입니다. 얼굴이나 움직임을 조용히 손상시키는 속도는 속도가 아니라 단지 거부되는 결과를 더 빠르게 생성하는 것일 뿐입니다.
나는 치료할 것이다 스펙트럼 흥미롭고 더 보수적인 대안으로서, 이번 타이밍 라운드의 승자가 아닙니다. 특히 EasyCache가 더 길거나 어려운 샷에서 눈에 띄는 오류를 쌓기 시작한다면, 통제된 품질 테스트를 받을 만합니다.
위한 커뮤니티 NSFW H3 미세 조정, 저는 안정적인 저장소, 모델 카드, 버전 기록, 재현 가능한 샘플을 기다릴 것입니다. 사라진 링크와 애매한 티저만으로도 호기심을 느끼게 충분합니다. 그러나 그것만으로는 생산 워크플로우를 구축하기에 충분하지 않습니다.
위하여 완-애니메이트-2 대 SCAIL-2, 나는 나만의 일치된 입력을 실행할 것이다. 두 프로젝트 모두 진지한 테스트를 받을 만큼 충분히 개방적이다. 원래 기사에 있는 샘플들은 단순히 그 질문에 대한 답을 주지 않는다.
그것은 '모델 A가 모델 B를 파괴한다'는 말만큼 흥미롭게 들리지는 않을 수 있지만, 훨씬 더 유용합니다. AI 벤치마킹에는 이미 충분한 가짜 확신이 존재합니다. 우리는 서로 관련 없는 두 비디오에서 또 다른 승자를 만들어낼 필요가 없습니다.
자주 묻는 질문
MiniMax H3는 공식적으로 NSFW 모델인가요?
아니요. MiniMax H3는 범용 멀티모달 모델입니다. 여기서 논의된 NSFW 빌드는 독립적인 커뮤니티 파인튜닝으로, 공식 MiniMax 출시가 아닙니다.
EasyCache가 MiniMax H3에서 항상 Spectrum보다 빠른가요?
입증되지 않음. EasyCache SageAttention은 이 특정 15초, 544 × 960 테스트에서 약 2.3배 더 빨랐습니다. 다른 하드웨어, 시드, 노드 버전 및 품질 설정에 따라 결과가 달라질 수 있습니다.
공개 NSFW 데모가 전체 노골적인 프롬프트를 완료했나요?
공개된 클립은 그것을 보여주지 않습니다. 클립은 옷을 입은 상태로 유지되며 티저로 끝나기 때문에 프롬프트에 설명된 전체 탈의 장면을 확인할 수 없습니다.
Wan-Animate-2가 SCAIL-2보다 더 나은가요?
두 개의 원본 클립은 통제된 비교가 아닙니다. 서로 다른 입력과 길이를 사용하므로 두 워크플로가 모두 실행된다는 것만 보여주며, 어느 쪽이 더 나은지는 보여주지 않습니다.
왜 Wan-Animate-2 작업 흐름은 81 프레임을 사용하나요?
그것은 시연된 ComfyUI 워크플로우에서 사용된 청크 길이입니다. 24fps에서는 더 긴 타깃이 여러 81프레임 청크로 나뉜 후 조립됩니다.
Wan-Animate-2는 GPU 하드웨어를 얼마나 필요로 하나요?
공식 프로젝트 문서에는 여덟 개의 A800 GPU에서 기본 720p 설정과 두 개의 A800에서 테스트된 480p 설정이 나와 있습니다. 커뮤니티 노드와 오프로딩은 요구 사항을 줄일 수 있지만, 일반적으로 속도 저하를 수반합니다.
이 모델들을 성인용 콘텐츠에 사용할 수 있나요?
지역적 이용 가능성은 법적 또는 동의 요구사항을 제거하지 않습니다. 분명히 성인을 나타내는 캐릭터와 적절히 라이선스가 부여된 참조 이미지, 음성, 운전 장면만 사용하십시오. 실제 사람의 친밀한 딥페이크를 동의 없이 생성하지 마십시오.