Вчера я закончил тестирование одной установки ускорения MiniMax H3. Сегодня приземлился ещё один.
Конечно, так оно и было.
Вот ComfyUI в 2026 году: ваш тест едва успевает остыть, как кто-то выпустит новый узел и сделает всё это устаревшим. Вчерашняя установка была EasyCache плюс SageAttention. Сегодняшними дополнениями стали Spectrum и ещё один плагин скорости, циркулирующий в китайском сообществе ComfyUI. Примерно в то же время Wan-Animate-2 наконец стал открытым исходным кодом, что дало мне ещё один повод сравнить его со SCAIL-2.
Таким образом, это превратилось в три теста, а не в один:
- EasyCache + SageAttention против Spectrum на MiniMax H3;
- обычный вывод H3 в сравнении с тонкой настройкой NSFW, созданной сообществом;
- Wan-Animate-2 и SCAIL-2 для анимации персонажей.
Краткая версия: EasyCache с большим преимуществом выиграл тест на синхронизацию, опубликованный NSFW клип оказался хуже заявленных, а два образца анимации персонажей далеко не настолько контролируемы, чтобы назвать победителя. Длинная версия более интересна.
Примечание редактора: Это адаптация практических заметок на родном английском языке, первоначально опубликованная 赵KK搞AI в WeChat, а не построчный перевод. Результаты тестов и мнения от первого лица сохраняются от первоначального автора; технический контекст и предостережения были проверены на основе официальных репозиториев проекта.
Сначала тест скорости:692 секунды против 1,590 секунд
Оба запуска MiniMax H3 создали 15-секундный вертикальный клип с разрешением 544 × 960. Рабочий процесс EasyCache + SageAttention завершился через 692.69 секундыили о 11 минут 33 секунды. Спектр взял 1,590.15 секундыили о 26 минут 30 секунд.
Это примерно делает EasyCache + SageAttention В этом забеге в 2.3 раза быстрее. Это сократило время ожидания чуть более чем на 56%.
| Настройка МиниМакса H3 | Выход | Измеренное время | Относительный результат |
|---|---|---|---|
| EasyCache + SageAttention | 15 с, 544 × 960 | 692.69 с | 1.0× |
| Спектр | 15 с, 544 × 960 | 1,590.15 с | в 2.3× длиннее |

EasyCache + SageAttention запускается, как записано в ComfyUI. Исходное изображение:赵KK搞AI.

Два записанных времени выполнения задачи. Это полезный скриншот; это избавляет нас от притворства, будто «чувствуешь себя быстрее» — это критерий. Исходное изображение:赵KK搞AI.
15-секундный вывод MiniMax H3, прикрепленный к тесту на ускорение. Исходное видео:赵KK搞AI.
Прежде чем кто-нибудь превратит цифру 2.3× в универсальный закон: не. В статье не представлен полный лист воспроизводимости с указанием модели графического процессора, версий программного обеспечения, начальных значений, параметров выборки и настроек для каждого узла. Это реальный результат рабочего процесса, а не рецензируемая таблица лидеров скорости.
Тем не менее, такая большая разница – это не пустяки. Если бы мой единственный вопрос был: «Какая настройка позволит мне быстрее получить ещё один черновик на этой машине?», EasyCache + SageAttention был бы очевидным первым выбором.
Почему EasyCache здесь оказался быстрее
Два ускорителя не делают одного и того же.
EasyCache — более агрессивный подход. Проще говоря, он пытается повторно использовать работу, полученную на предыдущих этапах шумоподавления, вместо того, чтобы каждый раз заново выполнять полный расчет. Когда генерация остается стабильной, это может сэкономить много вычислительных ресурсов. Риск столь же легко понять: если кэшированная оценка начнет отклоняться, ошибка может накапливаться.
Спектр является более сдержанным. Его реализация ComfyUI использует прогнозирование функций — прогнозирование Чебышева и гребневую регрессию — для прогнозирования характеристик промежуточного трансформатора, а затем позволяет модели продолжать уточнять результат. Это меньше похоже на фотокопирование предыдущего прохода и больше похоже на набросок следующего на основе недавней траектории, прежде чем модель ее очистит.
Это делает Spectrum технически интересным. В этом конкретном тесте он не показал скорости.
| Что это меняет | EasyCache + SageAttention | Спектр |
|---|---|---|
| Основная идея | Повторное использование предыдущих вычислений и снижение затрат внимания | Прогнозирование промежуточных функций из недавней истории |
| Откуда прибыль | Пропуск большего количества повторяющихся действий | Избегание некоторых вычислений трансформатора |
| Вероятный компромисс | Больше возможностей для накопленного дрейфа | Более консервативное ускорение |
| Результат в этом тесте | 692.69 с | 1,590.15 с |
Чего не хватает, так это правильного визуального A/B: одно и то же начальное значение, тот же источник, та же Промпт, те же настройки выборки, оба результата доступны в полном качестве. Без этого я могу сказать вам, какой забег закончился первым. Я не могу честно сказать вам, какой метод сохранил больше деталей.
Это различие имеет значение. Точно так же мы пытаемся отделить утверждение поставщика от наблюдаемого результата в Методика проверки NSFWAITool. Секундомер может подтвердить скорость. Сам по себе он не может доказать качество изображения.
«Модель NSFW MiniMax H3» нуждается в звездочке
Обсуждаемая здесь версия NSFW была не официальный релиз MiniMax. официальный репозиторий MiniMax H3 описывает мультимодальную модель общего назначения. Сборка, ориентированная на взрослых, была создана независимым разработчиком сообщества, который, как сообщается, протестировал пять версий.
Ссылка быстро исчезла и при проверке уже возвращала ошибку 404. Это раздражает, но это также нормально в этом уголке ИИ с открытым исходным кодом: модель может быть выпущена, отражена, переименована или удалена до того, как большинство людей завершит ее загрузку. Если производственный процесс зависит от того, чтобы один непроверенный репозиторий сообщества оставался в сети навсёгда, то такого рабочего процесса на самом деле ещё не существует.
В оригинальном тесте в качестве базовой линии использовалась длинная Промпт о моде с несколькими камерами. Он предусматривал вертикальный 15-секундный ролик, несколько объективов и ракурсов, единый стиль, музыку, освещёние и индивидуальность во всёх кадрах. Обычный результат H3 ниже.
Базовый модный выпуск MiniMax H3. Видимый знак «V» является частью исходного клипа и сохранен. Исходное видео:赵KK搞AI.
В тесте для взрослых Промпт сохранила ту же структуру с несколькими камерами, но сменила процесс одевания на явную последовательность раздевания. Это разумный способ проверить точную настройку: сохраните дизайн кадра и измените поведение, которое вы действительно хотите измерить.
Вот общедоступный результат, включенный в оригинальную статью:
Опубликован тизер сообщества тонкой настройки NSFW. Исходные китайские субтитры заменены английскими субтитрами; знак «V» остается частью исходного видео. Исходное видео:赵KK搞AI.
И вот здесь мне придется немного испортить маркетинг: в публичном ролике не показана полная последовательность раздевания, описанная в промпте. Он остается одетым и заканчивается дразнящей фразой, которая звучит так: «Если ты действительно хочешь это увидеть, попробуй сам». Забавный? Да. Доказательства полного поведения без цензуры? Нет.
Так что я бы расценил это как свидетельство того, что сообщество NSFW H3 доработало и могло создать связный тизер на взрослую тематику. Я бы не стал использовать общедоступный клип в качестве доказательства того, что он выполнил всё явные инструкции. Это два разных утверждения, и если смешать их вместе, демо-версии ИИ превращаются в ерунду.
Если вы сравниваете размещённые и локальные варианты видео для взрослых, то более широкий каталог ИИ-генераторов порно-видео это лучшая отправная точка, чем делать ставку на удаленный репозиторий.
Wan-Animate-2 стал открытым исходным кодом, так что да, я тоже его протестировал.
Ван-Анимат-2 выпустила свой код вывода и веса модели в августе 2026 года. Проект использует эталонный персонаж непосредственно из исходного видео, пытаясь сохранить идентичность, движение, выражение лица и поведение камеры. Это сквозная система, поэтому ей не нужен отдельный экстрактор поз, расположенный в середине конвейера.

Обзор конвейера Wan-Animate-2, включенный в исходную статью. Исходное изображение:赵KK搞AI; технические подробности: Проект Wan-Animate-2.
Быстрый обход, потому что, видимо, об этом ещё нужно сказать: Wan 3.0 не имеет открытого исходного кода. Это разочаровывает. Это не делает анонимное оскорбление разработчиков умным или принципиальным. Вы используете модели, на создание которых другие люди потратили месяцы, а затем ведете себя как лично преданные, потому что они не передали вам следующую модель в выбранный вами график. Если вы можете собрать Wan 4.0 самостоятельно, сделайте это. Я буду первым в очереди и попрошу вас снять гири.
Открытый исходный код Wan-Animate-2 не решает волшебным образом спор о Wan 3.0, но это по-прежнему значимый выпуск. Экосистема WAN остается одним из немногих мест, где люди могут проверять, изменять и подключать модель к частному конвейеру ComfyUI. Это имеет ещё большее значение для проектов для взрослых, где размещённые продукты могут вообще не поддерживать материал. Наш более длинный Процесс создания короткометражных фильмов для взрослых в Wan 2.2 объясняет, почему локальный контроль становится производственным требованием, когда проект выходит за пределы нескольких клипов.
В настройке Wan-Animate-2 есть один шаг, который легко пропустить.
Перед запуском анимации опорное изображение должно быть описано с помощью LLM. Официальный проект рекомендует объективное описание внешности и биографии персонажа, исключая действия, субъективные суждения и эмоциональные домыслы.
На естественном английском языке инструкция в основном следующая:
Описывайте только то, что заметно присутствует на эталонном изображении. Опишите внешний вид объекта, одежду, волосы, аксессуары и фон. Не описывайте действия. Не угадывайте личность, настроение или намерение.
Это звучит суетливо, пока вы не поймете, почему это помогает. Видео вождения уже передает действие. Если текстовое описание предполагает другое действие, вы дали модели двух режиссеров, выкрикивающих разные инструкции.

Wan-Animate-2 в ComfyUI. Исходное изображение:赵KK搞AI.
Другая настройка, которую люди ошибаются, — это длина кадра. При 24 кадрах в секунду математика проста:
продолжительность в секундах × 24 = количество целевых кадров
Рабочий процесс, показанный в исходном коде, использует фрагменты по 81 кадру, поэтому для более длинных клипов требуется несколько проходов.
| Целевая продолжительность | Кадры со скоростью 24 кадра в секунду | Нужны фрагменты по 81 кадру |
|---|---|---|
| 3 секунды | 72 | 1 |
| 5 секунд | 120 | 2 |
| 8 секунд | 192 | 3 |
| 10 секунд | 240 | 3 |
| 15 секунд | 360 | 5 |
| 30 секунд | 720 | 9 |

В рабочем процессе используется настройка длины 81 кадра. Исходное изображение:赵KK搞AI.
Стандартная настройка 720p в официальном репозитории настроена на восемь графических процессоров A800, а протестированная конфигурация 480p — на двух A800. Это не дружелюбное требование «щелкнуть промпт о очереди на моем ноутбуке». Оптимизация сообщества будет продолжать уменьшать объем памяти, но любой, кто пишет об этом так, будто локальная анимация персонажей бесплатна, явно никогда не видел, как индикатор выполнения ползет по реальному рабочему процессу.
Wan-Animate-2 против SCAIL-2: клипы не доказывают победителя
СКЭЙЛ-2 проект использует аналогичный сквозной маршрут. Он позволяет избежать промежуточного представления позы и добавляет семантику маски, а также обработку нескольких ссылок. Его официальная версия поддерживает рабочие процессы 512p и 704p, при этом проект рекомендует вариант с управлением позой в 704p.
Вот образец Wan-Animate-2, сохранившийся из оригинальной статьи:
Образец Wan-Animate-2. Исходный файл быстро чередует вид движения/справки и сгенерированный персонаж; здесь воспроизведено без изменений. Исходное видео:赵KK搞AI.
А вот образец SCAIL-2:
Образец анимации персонажа SCAIL-2. Исходное видео:赵KK搞AI.
Я не буду объявлять победителя по этим двум клипам, потому что это было бы фальшивой точностью. Они используют разных персонажей, разные источники движения, разные кадры и разную продолжительность. Загрузка Wan-Animate-2 занимает всёго около 2.7 секунды, а изображения чередуются так быстро, что о временных дефектах трудно судить. Зажим SCAIL-2 работает почти девять секунд, и его гораздо легче проверять, но «легче проверять» — это не то же самое, что «лучшая модель».
Для настоящего сравнения требуется одно и то же референсное изображение, управляющее видео, разрешение, количество кадров, аппаратное обеспечение, политика заполнения и постобработка. Затем я оценивал сохранение идентичности, устойчивость рук, восстановление окклюзии, выражение лица, движение ткани, утечку фона и общее время рендеринга. Все, что меньше, — это сравнение демонстрационных роликов.
Что бы я на самом деле использовал после этих тестов
Что касается скорости итерации MiniMax H3, я бы начал с EasyCache + SageAttention. Разрыв в этом раунде слишком велик, чтобы его игнорировать. Я бы всё равно отрендерил несколько совпадающих образцов, прежде чем пойти на компромисс с качеством, потому что скорость, которая незаметно повреждает лица или движение, не является скоростью — она просто приводит к более быстрому появлению брака.
я бы лечил Спектр как интересная, более консервативная альтернатива, а не победитель этого раунда. Он заслуживает контролируемого теста качества, особенно если EasyCache начинает накапливать видимые ошибки в более длительном или сложном процессе.
Для точная настройка сообщества NSFW H3, я бы дождался стабильного репозитория, карточки модели, истории версий и воспроизводимых образцов. Исчезнувшей ссылки и скромного тизера достаточно, чтобы вызвать у меня любопытство. Их недостаточно, чтобы построить вокруг них производственный процесс.
Для Wan-Animate-2 против SCAIL-2, я бы запустил свои собственные согласованные входы. Оба проекта достаточно открыты, чтобы заслужить серьезное тестирование. Образцы в оригинальной статье просто не отвечают на вопрос.
Это может показаться менее захватывающим, чем «Модель А разрушает Модель Б», но это гораздо полезнее. В бенчмаркинге ИИ уже достаточно ложной уверенности. Нам не нужно создавать ещё одного победителя из двух несвязанных видео.
Часто задаваемые вопросы
MiniMax H3 официально является моделью NSFW?
Нет. MiniMax H3 – мультимодальная модель общего назначения. Обсуждаемая здесь сборка NSFW была доработкой независимого сообщества, а не официальным выпуском MiniMax.
Всегда ли EasyCache быстрее Spectrum на MiniMax H3?
Не доказано. EasyCache + SageAttention работал примерно в 2.3 раза быстрее в этом конкретном 15-секундном тесте с разрешением 544 × 960. Различное оборудование, начальные значения, версии узлов и настройки качества могут изменить результат.
Заполнила ли общедоступная демонстрация NSFW полное явное приглашение?
Опубликованный клип этого не показывает. Он остается одетым и заканчивается тизером, поэтому он не может проверить полную последовательность раздевания, описанную в промпте.
Wan-Animate-2 лучше, чем SCAIL-2?
Два исходных клипа не являются контролируемым сравнением. Они используют разные входные данные и длину, поэтому показывают, что работают оба рабочих процесса, а не какой из них лучше.
Почему процесс Wan-Animate-2 использует 81 кадр?
Это длина фрагмента, используемая в продемонстрированном рабочем процессе ComfyUI. При частоте 24 кадра в секунду более длинные цели делятся на несколько фрагментов по 81 кадр, а затем собираются.
Сколько графического процессора требуется Wan-Animate-2?
Официальный проект документирует настройку 720p по умолчанию на восьми графических процессорах A800 и протестированную настройку 480p на двух A800. Узлы сообщества и разгрузка могут снизить требования, обычно за счет скорости.
Можно ли использовать эти модели для контента для взрослых?
Локальная доступность не отменяет юридических требований или требований согласия. Используйте только явно взрослых персонажей и лицензированные справочные изображения, голоса и кадры вождения. Не создавайте интимные дипфейки реальных людей без согласия.