Seedance 2.5 is live — 30-second cinematic video with native audio & real-person references
Лучшие модели видео с открытым кодом для локальных GPU (2026)
2026/07/30

Лучшие модели видео с открытым кодом для локальных GPU (2026)

Сравниваем Wan 2.2, HunyuanVideo-1.5, CogVideoX1.5 и Mochi 1 по объёму памяти GPU, качеству выходных видео, лицензии, скорости и ограничениям развёртывания.

Wan 2.2 TI2V-5B — лучший универсальный локальный генератор видео на одной GPU с 24GB памяти. HunyuanVideo-1.5 — наиболее надёжная точка старта для 14–16GB, а CogVideoX1.5-5B — самый реалистичный эксперимент ниже. Mochi 1 остаётся интересен лицензией Apache-2.0 и модифицируемым pipeline, но потребление памяти и выход только в 480p делают его специализированным, а не универсальным выбором.

Но есть важная оговорка: опубликованное значение минимума VRAM обычно предполагает offload на CPU, tiling, сниженную точность, или всё сразу. Оно показывает, что задача может поместиться. Оно не говорит, что будет достаточно быстро для ежедневного использования.

Это сравнение использует официальные карточки моделей и репозитории проектов, проверенные 30 июля 2026 года. Мы применяем термин «модель генерации видео с открытым кодом», потому что так его ищут пользователи. «Open-weight» часто точнее, особенно если модель использует пользовательскую лицензию от сообщества.

Лучшие локальные генераторы видео на одной странице

МодельОпубликованная рута VRAMВыход видеоЛицензияЛучше всего для
Wan 2.2 TI2V-5BМинимум 24GB с offload на CPU[1]720p, 24fps; text-to-video и image-to-videoApache-2.0Лучший баланс для одной рабочей станции с 24GB
HunyuanVideo-1.5Минимум 14GB с offload модели[2]480p/720p T2V и I2V, плюс отдельный путь super-resolutionTencent Hunyuan Community LicenseЛучше всего задокументирован для CUDA GPU 14–16GB
CogVideoX1.5-5BDiffusers BF16 с 10GB; INT8 с 7GB[3]1360×768, 5 или 10 секундCogVideoX LicenseТесты при низком VRAM, когда медленная генерация допустима
Mochi 1 preview22GB для примера Diffusers с понижением точности; около 60GB для официального репозитория на одну GPU[4]Первый релиз нацелен на text-to-video в 480pApache-2.0Исследования, LoRA-адаптация и permissive-лицензия

Эти строки не эквивалентны по бенчмаркам. Минимум CogVideoX использует другую точность и стратегию памяти, чем документированная команда на 24GB для Wan. Пример Mochi на 22GB явно допускает небольшое снижение качества. Воспринимай числа как варианты развёртывания, а не как рейтинг качества.

Что реалистично сможет выполнять твоя GPU

8GB VRAM: технический тест, не удобная рабочая станция

CogVideoX1.5-5B — единственная модель в группе, для которой издатель документирует Diffusers путь INT8 с 7GB. Та же карточка модели предупреждает, что квантизация и последовательный offload CPU снижают скорость. Низкопамятные тесты проводились на оборудовании A100/H100, но авторы говорят, что подход должен в целом работать на картах NVIDIA Ampere и новее[3].

Карта на 8GB может доказать, что модель запускается, но оставляет мало места для дисплея, декодера, более длинных клипов или другого процесса. Жди подбора зависимостей и значительного объёма системной памяти. Для боевого использования облачное задание или более мощная GPU обычно меньше раздражают.

10–12GB VRAM: CogVideoX становится пригоден для терпеливых экспериментов

Оптимизированный путь Diffusers BF16 CogVideoX1.5-5B начинается примерно с 10GB. Это лучший первый тест, чем INT8, если карта его вмещает. Компромисс — время: собственные результаты издателя на 50 шагов для пятисекундного клипа считаются сотнями секунд даже на H100, и ещё больше на A100[3]. Это не прогнозы на потребительских GPU, но они чётко показывают узкое место.

CogVideoX также ожидает подсказки на английском. Команды, принимающие промпты на других языках, нуждаются в предварительном переводе или переписи подсказок перед инференцией.

14–16GB VRAM: HunyuanVideo-1.5 — практический шаг вверх

Tencent публикует минимум в 14GB с включённым offload модели. Официальный путь нацелен на Linux, Python 3.10 или новее и NVIDIA CUDA GPU[2]. Это намного более надёжная точка старта, чем неофициальное сообщество утверждение, что крупная видео-модель «работает на 12GB».

HunyuanVideo-1.5 поддерживает checkpoints text-to-video и image-to-video в 480p и 720p. Его отдельная модель super-resolution может увеличить видео до 1080p. Этот шаг — дополнительная работа; его не стоит описывать как встроенную генерацию 1080p.

Главное ограничение скорее правовое, чем техническое. Лицензия Tencent Hunyuan Community License исключает использование в Европейском союзе, Великобритании и Южной Корее, включает ограничения на использование и требует отдельной лицензии для некоторых продуктов выше установленного порога пользователей[5]. Прочитай актуальную лицензию перед выбором для коммерческого сервиса.

24GB VRAM: полезный уровень локальной генерации видео

Здесь локальная генерация перестаёт быть трюком с памятью. Wan 2.2 TI2V-5B имеет официальную команду на одну GPU для карты RTX 4090 класса 24GB. Поддерживает text-to-video и image-to-video в одном 5B pipeline и выдаёт видео класса 720p при 24fps[1].

Карточка модели Wan говорит, что 5B модель может сгенерировать пятисекундное 720p видео менее чем за девять минут на одной потребительской GPU без специальной оптимизации. Полезно для превью и пакетной работы, но это не интерактивный монтаж. Дизайн очереди остаётся важен.

Mochi 1 тоже может поместиться на этом уровне через свой Diffusers пример BF16 с 22GB. Genmo отмечает небольшое снижение качества для этого пути. С малым запасом VRAM другое приложение или другой счёт кадров может вышвырнуть задачу из памяти[4]. Выбирай Mochi здесь за исследовательскую ценность и лицензию, не потому что это самое безопасное развёртывание на 24GB.

48–80GB VRAM: меньше компромиссов, не гарантированная пропускная способность

Более качественный Diffusers пример Mochi требует 42GB, а его официальный репозиторий описывает около 60GB для работы на одной GPU и рекомендует H100[4]. Больше памяти может снизить offload для других моделей или поддержать несколько worker'ов.

Это не убирает вычислительную стоимость диффузии. Перед покупкой более мощной карты измерь количество принятых клипов в час, не количество отправленных промптов.

Wan 2.2: лучший вариант в целом для 24GB GPU

Wan 2.2 TI2V-5B даёт самое чистое сочетание локальной практичности и возможностей выхода в группе:

  • официальные веса и код инференции;
  • документированный путь на одну GPU с 24GB;
  • text-to-video и image-to-video в одной модели;
  • выход класса 720p при 24fps;
  • лицензия Apache-2.0.

Будь точен с названием модели. Wan 2.2 также имеет более крупные checkpoints A14B. Урок, показывающий TI2V-5B на 4090, не доказывает, что более крупные варианты поместятся на том же оборудовании. Размер скачивания, аргументы инференции и требования к памяти различаются.

Wan — обоснованный бенчмарк для независимого создателя, исследовательской группы или студии с одной 4090. Его слабость — задержка. Одна машина может отрендерить полезный батч за ночь; это менее убедительно как backend для продукта, обещающего немедленные результаты.

HunyuanVideo-1.5: лучший вариант при 14–16GB

HunyuanVideo-1.5 упаковывает 8.3B видео-модель в удивительно доступный официальный минимум. Это самый сильный кандидат здесь, когда машина не может достичь 24GB, но всё ещё нужны text-to-video и image-to-video.

Его семейство моделей сложнее одного скачивания. Tencent перечисляет отдельные checkpoints для 480p и 720p, дистилляцию и веса super-resolution. Определи, какой путь нужен продукту, до выделения хранилища или построения контейнера.

Эта модель также самый ясный пример того, почему «открытый» и «permissive» — разные вопросы. Веса и код обучения доступны, но лицензия сообщества имеет территориальные, авторские, дистрибьютивные ограничения и условия приемлемого использования. Предположения Apache-2.0 не переносятся.

CogVideoX1.5-5B: лучший тест при низком VRAM

CogVideoX1.5-5B выигрывает в конкурсе размещения. Официальная карточка модели документирует конфигурации Diffusers BF16 с 10GB и INT8 с 7GB, сравнены с 76GB для её пути BF16 SAT[3]. Этот разброс показывает, как сильно путь software меняет ответ hardware.

Выбирай CogVideoX когда:

  • доступная GPU имеет 8–12GB;
  • генерация может работать в фоне;
  • промпты можно нормализовать на английский;
  • команда уютна с пиннингом зависимостей CUDA, PyTorch, Diffusers и квантизации.

Не выбирай его только потому что «7GB» выглядит эффективно. INT8 путь обменивает скорость на память, и 5–10 секундный выход модели остаётся дорогим для повторного семплирования. Установка с 12GB, которая стабильно завершается, может быть полезнее, чем конфигурация с 8GB, работающая на пределе.

CogVideoX использует собственную лицензию. Прочитай текст для запланированного распределения и коммерческого использования вместо того чтобы считать «скачивается на Hugging Face» юридическим выводом[6].

Mochi 1: лучший для permissive исследовательской работы

Mochi 1 — это 10B превью text-to-video выпущено под Apache-2.0. Genmo публикует веса, код инференции, программируемый pipeline и LoRA тренер. Это хороший фундамент для команд, заботящихся о модификации стека, а не просто производстве видео максимального разрешения.

Его ограничения необычно хорошо документированы. Начальный checkpoint нацелен на 480p, настроен под фотореализм, может показывать искажения при экстремальном движении и хуже справляется с мультипликационными стилями[7]. Официальная реализация также требует около 60GB VRAM на одну GPU. Diffusers сводит это к 22GB в BF16, но с установленным компромиссом качества.

Mochi имеет смысл на исследовательской рабочей станции или много-GPU сервере. Сложнее оправдать для создателя, покупающего одну карту специально для 720p выхода.

«Запускается локально» имеет четыре разных значения

Сравнения моделей часто коллапсируют четыре вехи в одну:

  1. Процесс стартует. Веса загружаются с квантизацией и offload'ом.
  2. Одна выборка завершается. Короткая, низкобатчевая задача избегает ошибки out-of-memory.
  3. Workflow повторяемый. Десять задач завершаются без фрагментации памяти, краша драйвера или ручной очистки.
  4. Система полезна. Пропускная способность, степень принятия выхода и операционный труд превосходят доступную альтернативу.

Только четвёртая веха поддерживает решение production. CPU offload смещает нагрузку на системную RAM и PCIe передачи. Квантизация может снизить память, но замедляет инференцию. VAE tiling экономит память, но меняет профиль выполнения. Потребительская GPU также теряет часть ёмкости дисплею и другим приложениям.

Замкнутые хостинговые модели — отдельная категория: API или ComfyUI ноде может выставить знакомое имя модели, пока вся инференция идёт удалённо. За конкретным примером различия см. объяснение может ли Seedance работать локально.

Честный локальный бенчмарк займёт один вечер

Не начинай с большой библиотеки промптов. Используй пять промптов, которые выставляют разные режимы отказа:

  • неподвижная камера с одним движущимся объектом;
  • две люди взаимодействуют;
  • быстрое боковое движение;
  • image-to-video с лицом или товаром, который должен оставаться консистентным;
  • сцена с текстом, руками или повторяющейся геометрией.

Запусти каждую модель в разрешении, длительности и памяти, которые ты реально будешь отправлять. Записывай:

МетрикаПочему важна
Пиковой VRAMПоказывает, переживёт ли workflow реальные сервисы рядом
Пиковая системная RAMПоказывает скрытую стоимость CPU offload'а
Холодный стартВажна для serverless worker'ов и перезапущенных очередей
Секунд на клипОпределяет capacity, но не качество
Принятых клипов из десяти попытокЛовит движение, идентичность и отказы промптов
Ватт-часов на принятый клипДелает локальную операционную стоимость сравнимой
Ручные вмешательстваВыставляет хрупкий pipeline до production

Держи сиды и промпты фиксированными. Если модели нужна переписка промпта, сохрани эту переписку как часть её pipeline вместо того чтобы молча дать ей лучший промпт во время оценки.

Перед развёртыванием open-weight видео-модели

Checkpoint — только один компонент. Надёжный локальный сервис также нуждается в:

  • достаточного NVMe места для весов, кэшей, входов и отрендеренных кадров;
  • пиннинговании версий NVIDIA драйвера, CUDA, PyTorch и attention библиотек;
  • worker'е, освобождающем GPU память после неудачных задач;
  • лимитах запроса на длительность, разрешение, счёт кадров и размер батча;
  • модерации выхода и политике для загруженных лиц или авторских активов;
  • уведомлениях о модели и лицензии, переносимых в продукт где требуется;
  • воспроизводимых бенчмарк промптах для апгрейдов.

Отказы видео-диффузии дорогие, потому что приходят поздно. Worker может потратить минуты перед возвратом ошибки out-of-memory или бесполезного клипа. Валидируй входы и забронируй память до того как задача попадёт в очередь генерации.

ЧПУ

Какой лучший модель ИИ для генерации видео с открытым кодом для 12GB VRAM?

CogVideoX1.5-5B — самый ясный документированный выбор. Его официальная карточка модели перечисляет оптимизированный Diffusers путь BF16 с 10GB и INT8 путь с 7GB. Оба полагаются на техники экономии памяти и могут быть медленными.

Какой лучший локальный видео-модель для RTX 4090?

Wan 2.2 TI2V-5B — лучшая точка старта в этом сравнении. Издатель документирует одно-GPU настройку на 24GB, выход класса 720p при 24fps и поддержку text-to-video и image-to-video.

Может ли HunyuanVideo-1.5 работать на 16GB VRAM?

Да, согласно опубликованному минимуму Tencent в 14GB с offload модели. Официальная настройка нацелена на Linux и NVIDIA CUDA GPU. Доступная системная RAM и скорость хранилища всё ещё влияют на опыт.

Praktikum ли Mochi 1 на 24GB GPU?

Может поместиться используя официальный Diffusers пример BF16 на 22GB, который отмечает небольшое снижение качества. Его официальная реализация требует гораздо больше памяти, и начальная модель нацелена на 480p, так что Wan 2.2 обычно более практичный выбор для 24GB.

Могу ли я использовать эти модели коммерчески?

Ответ зависит от модели. Wan 2.2 TI2V-5B и Mochi 1 используют Apache-2.0. HunyuanVideo-1.5 использует лицензию сообщества Tencent, а CogVideoX1.5 использует CogVideoX License. Прочитай актуальную лицензию, правила приемлемого использования, территорию и условия распределения для точного checkpoint. Этот статья — техническое сравнение, не юридический совет.

Предсказывает ли минимальный VRAM скорость генерации?

Нет. Самые маленькие конфигурации обычно экономят память через CPU offload, tiling или квантизацию, всё из которого может снижать скорость. Измеряй wall-clock время и принятые выходы на целевой машине.

Ссылки

  1. Wan-AI. Карточка модели и официальный репозиторий Wan2.2-TI2V-5B. Веса, лицензия Apache-2.0, выход 720p, команда на 24GB и руководство по производительности. Получено 30 июля 2026 из huggingface.co/Wan-AI/Wan2.2-TI2V-5B и github.com/Wan-Video/Wan2.2
  2. Tencent. Карточка модели HunyuanVideo-1.5. Официальный минимум 14GB, требования системы, checkpoints и пути выхода. Получено 30 июля 2026 из huggingface.co/tencent/HunyuanVideo-1.5
  3. Z.ai. Карточка модели CogVideoX1.5-5B. Цифры памяти Diffusers и SAT, компромиссы квантизации, длительность и разрешение. Получено 30 июля 2026 из huggingface.co/zai-org/CogVideoX1.5-5B
  4. Genmo. Карточка модели Mochi 1 preview. Примеры памяти Diffusers и компромисс сниженной точности. Получено 30 июля 2026 из huggingface.co/genmo/mochi-1-preview
  5. Tencent. Соглашение о лицензии Tencent Hunyuan Community. Территория, распределение, коммерческие и условия использования. Получено 30 июля 2026 из HunyuanVideo-1.5 LICENSE
  6. Z.ai. Лицензия CogVideoX. Лицензия, связанная с официальной карточкой модели. Получено 30 июля 2026 из CogVideoX1.5-5B LICENSE
  7. Genmo. Репозиторий Mochi. Руководство оборудования, лицензия Apache-2.0, архитектура и документированные ограничения. Получено 30 июля 2026 из github.com/genmoai/mochi

Автор

avatar for reAPI Team
reAPI Team

Категории

Лучшие локальные генераторы видео на одной страницеЧто реалистично сможет выполнять твоя GPU8GB VRAM: технический тест, не удобная рабочая станция10–12GB VRAM: CogVideoX становится пригоден для терпеливых экспериментов14–16GB VRAM: HunyuanVideo-1.5 — практический шаг вверх24GB VRAM: полезный уровень локальной генерации видео48–80GB VRAM: меньше компромиссов, не гарантированная пропускная способностьWan 2.2: лучший вариант в целом для 24GB GPUHunyuanVideo-1.5: лучший вариант при 14–16GBCogVideoX1.5-5B: лучший тест при низком VRAMMochi 1: лучший для permissive исследовательской работы«Запускается локально» имеет четыре разных значенияЧестный локальный бенчмарк займёт один вечерПеред развёртыванием open-weight видео-моделиЧПУКакой лучший модель ИИ для генерации видео с открытым кодом для 12GB VRAM?Какой лучший локальный видео-модель для RTX 4090?Может ли HunyuanVideo-1.5 работать на 16GB VRAM?Praktikum ли Mochi 1 на 24GB GPU?Могу ли я использовать эти модели коммерчески?Предсказывает ли минимальный VRAM скорость генерации?Ссылки