
ローカルGPU向けオープンソース動画AIモデル2026:4モデル比較
Wan 2.2、HunyuanVideo-1.5、CogVideoX1.5、Mochi 1をGPUメモリ、出力品質、ライセンス、推論速度、導入制限で比較します。
24GB GPUなら、Wan 2.2 TI2V-5Bが最も実用的なローカル動画AIモデルです。14~16GBはHunyuanVideo-1.5が最適で、それ以下ではCogVideoX1.5-5Bが現実的な選択肢となります。Mochi 1はApache-2.0ライセンスと改造可能なパイプラインで研究用途に向きますが、メモリ使用量と480p出力により、汎用というより専門的な選択肢です。
ただし大切な注釈があります。公開されている最小VRAM数は、通常CPUオフロード、タイリング、低精度、あるいはこれらの組み合わせを想定しています。それはワークフローが収まることを意味しますが、毎日実用的な速度があるかは別問題です。
この比較は各プロジェクトの公式モデルカードとリポジトリを使用し、2026年7月30日に確認しました。「オープンソースAI動画モデル」という言い方をしているのは、ユーザーが実際にこう検索するからです。「オープンウェイト」の方が正確な場合もありますが、特にカスタムコミュニティライセンスを採用するモデルではそうです。
一目でわかるローカル動画AIモデル
| モデル | 公開されたローカルVRAMパス | 動画出力 | ライセンス | 最適な用途 |
|---|---|---|---|---|
| Wan 2.2 TI2V-5B | CPUオフロード時に最低24GB[1] | 720pクラス、24fps;テキスト・画像ベース動画 | Apache-2.0 | 24GB単一ワークステーション向けバランス型 |
| HunyuanVideo-1.5 | モデルオフロード時に最低14GB[2] | 480p/720p T2V・I2V、超解像度パス | Tencent Hunyuan Community License | 14~16GB CUDA GPU向けの最良ドキュメント実装 |
| CogVideoX1.5-5B | Diffusers BF16で10GB以上;INT8で7GB以上[3] | 1360×768、5秒または10秒 | CogVideoX License | 低VRAM実験用(生成時間を許容できる場合) |
| Mochi 1 preview | 低精度Diffusers例で22GB;単一GPU参照実装では約60GB[4] | 初回リリースは480pテキスト・画像ベース動画対応 | Apache-2.0 | 研究、LoRA、寛容なライセンス条件 |
これらの行は厳密なベンチマーク等価ではありません。CogVideoXの最小値はWanのドキュメント24GBコマンドと異なる精度とメモリ戦略を使用します。Mochiの22GB例は意図的に品質をわずかに低下させています。これらの数字を展開ルートとして解釈し、品質ランキングではなく理解してください。
GPUで現実的に実行できるもの
8GB VRAM:技術実験で、実用的なワークステーションではない
CogVideoX1.5-5Bは、パブリッシャーが約7GBから始まるINT8 Diffusers パスをドキュメント化している唯一のモデルです。同じモデルカードで、量子化とシーケンシャルCPUオフロードが速度を低下させることを警告しています。低メモリテストはA100/H100ハードウェアで実施されましたが、著者らはNVIDIA Ampereまたはそれ以降のカードで一般的に動作するはずだと述べています[3]。
8GBカードはモデルが実行できることを証明できますが、ディスプレイ、デコーダ、長いクリップ、あるいは別のプロセスのためにほとんど余裕が残りません。依存関係のチューニングと大きなシステムRAMフットプリントを想定してください。定期的な本番運用には、ホストサービスまたはより大きなGPUが通常ストレスが少なくて済みます。
10~12GB VRAM:CogVideoXは根気強い実験に向く
CogVideoX1.5-5Bの最適化BF16 Diffusers パスは約10GBから始まります。INT8よりも、カードがそれを保有できるならば、最初のテストとしてこちらが優れています。トレードオフは時間です。パブリッシャー自身の50ステップ5秒クリップ結果はH100でも数百秒で計測され、A100ではそれ以上です[3]。これらはコンシューマーGPU予測ではありませんが、ボトルネックを明確にします。
CogVideoXは英語プロンプトを前提としています。他言語のプロンプトを受け入れるチームは、推論前に翻訳またはプロンプト書き換えステップが必要です。
14~16GB VRAM:HunyuanVideo-1.5は実践的なステップ
Tencentは14GB最小値をモデルオフロード有効で公開しています。公式ソースパスはLinux、Python 3.10以降、NVIDIA CUDA GPUをターゲットにしています[2]。これは大規模ビデオモデルが「12GBで動く」という非公式なコミュニティ主張より、はるかに堅実な出発点です。
HunyuanVideo-1.5は480pと720pでテキスト・画像ベース動画チェックポイントをサポートしています。別の超解像度モデルはビデオを1080pにアップスケールできます。最後のステップは追加作業で、ネイティブ1080p生成として説明すべきではありません。
主な制約は技術的ではなく法的です。Tencent Hunyuan Community Licenseは欧州連合、英国、韓国での使用を除外し、使用制限を含み、段階的なユーザーしきい値を超える特定製品向けに別ライセンスが必要です[5]。商用サービス向けにそれを選ぶ前に、現在のライセンスを読んでください。
24GB VRAM:実用的なローカル動画層
ここがローカル生成がメモリ制約の小技ではなく現実的になる地点です。Wan 2.2 TI2V-5Bは24GB RTX 4090クラスカード向けの公式単一GPU コマンドを持ちます。1つの5Bパイプラインでテキスト・画像ベース動画をサポートし、24fpsで720pクラスビデオを出力します[1]。
Wanのモデルカードは、5Bモデルが単一コンシューマーGPU上で特別な最適化なしに5秒720pビデオを9分以内に生成できると述べています。これはプレビューとバッチ処理には有用ですが、インタラクティブ編集ではありません。キューの設計は依然重要です。
Mochi 1も22GB BF16 Diffusers 例を通じてこの層に収まります。Genmoはそのパスに品質のわずかな低下を記載しています。スペアVRAMが少量だと、別のアプリケーションまたは異なるフレーム数がジョブをメモリ不足に押し出す可能性があります[4]。ここでMochiを選ぶのはその研究価値とライセンスのためで、最も安全な24GB導入だからではありません。
48~80GB VRAM:トレードオフ削減で、自動的なスループット増加ではない
Mochiの高品質Diffusers 例は42GBを必要とし、参照リポジトリは単一GPU操作について約60GBを説明し、H100を推奨しています[4]。より大きなメモリは他のモデルのオフロード削減またはワーカー複数化もサポートできます。
これは拡散の計算コストを除去しません。より大きなカード購入前に、送信プロンプト数ではなく、受け入れられたクリップ数/時間をベンチマークしてください。
Wan 2.2:24GB GPU向けバランス最適
Wan 2.2 TI2V-5Bはこのグループで最もクリーンなローカル実用性と出力能力の組み合わせを持ちます。
- 公式ウェイトと推論コード
- ドキュメント化された単一24GB GPU パス
- 同じモデル内のテキスト・画像ベース動画
- 24fpsでの720pクラス出力
- Apache-2.0 ライセンス
モデル名に正確でいてください。Wan 2.2はより大きなA14Bチェックポイントも持ちます。4090でTI2V-5Bを示すチュートリアルは、より大きなバリアントが同じハードウェアに収まることを証明しません。ダウンロードサイズ、推論引数、メモリ要件は異なります。
Wanは独立クリエイター、研究チーム、または4090を1台持つスタジオ向けの合理的な最初のベンチマークです。その弱点はレイテンシーです。単一マシンは実用的なバッチを一晩でレンダリングできます。即座の結果を約束する製品のバックエンドとしてはそこまで説得力がありません。
HunyuanVideo-1.5:14~16GB向けベスト
HunyuanVideo-1.5は8.3Bビデオモデルを驚くほどアクセス可能な公式最小値の周りにパッケージしています。マシンが24GBに到達できないがテキスト・画像ベース動画の両方が必要な場合、ここで最強の候補です。
そのモデルファミリーは1つのダウンロードより複雑です。Tencentは別の480pと720pチェックポイント、蒸留バリアント、超解像度ウェイトをリストしています。製品が実際に必要なパスを決めてから、ストレージやコンテナの構築を開始してください。
このモデルは「オープン」と「寛容」が異なる質問である理由の最もクリアな例です。ウェイトと訓練コードは利用可能ですが、コミュニティライセンスは領土、帰属、配布、受容可能使用条件があります。Apache-2.0の仮定は従いません。
CogVideoX1.5-5B:低VRAM実験向けベスト
CogVideoX1.5-5Bは適合コンテストに勝ちます。公式表は10GB BF16と7GB INT8 Diffusers 設定をドキュメント化し、76GB BF16 SAT ルートと比較しています[3]。その広がりはソフトウェアパスがハードウェア答えをどれだけ変えるかを示します。
CogVideoXを選ぶのは:
- 利用可能GPU が8~12GB
- 生成がバックグラウンドで実行可能
- プロンプトを英語に正規化できる
- チームが CUDA、PyTorch、Diffusers、量子化依存関係をピンするのに快適
「7GB」が効率的に見えるだけで選ばないでください。INT8パスはメモリのためにスピードをトレードオフし、モデルの5または10秒出力は反復的にサンプリングするのに依然高コストです。確実に完了する12GB インストールが限界で動作する8GB設定より実用的です。
CogVideoXは自らのライセンスを使用します。「Hugging Faceでダウンロード可能」を法的結論として扱うのではなく、計画配布と商用使用のテキストを確認してください[6]。
Mochi 1:寛容な研究作業向けベスト
Mochi 1は10Bテキスト・画像ベース動画研究プレビューで、Apache-2.0で公開されています。Genmoはウェイト、推論コード、プログラム可能パイプライン、LoRA トレーナーを公開しています。これはスタック修正より最高解像度クリップを単に製造することに関心を持つチーム向けの良いベースです。
その制限は通常よくドキュメント化されています。初期チェックポイントは480pをターゲットにし、フォトリアリズム向けチューニング、極端なモーション下の歪み可能性、アニメスタイルでの劣った性能を示します[7]。参照実装も1つのGPUで約60GB VRAMが必要です。Diffusers はそれをBF16で22GBに下げ、記載品質トレードオフを伴います。
Mochiは研究ワークステーション、またはマルチGPUサーバーで意味があります。完成720p出力のためだけに特にカード購入する単一クリエイターに正当化するのは難しい。
「ローカル実行」には4つの異なる意味がある
モデル比較はしばしば4つのマイルストーンを1つに折りたたみます。
- プロセスは開始します。 ウェイトは量子化とオフロードで読み込みます。
- 1つのサンプルが完了します。 短い、低バッチジョブはメモリ不足エラーを回避します。
- ワークフローは反復可能です。 10のジョブがメモリ断裂化、ドライバクラッシュ、手動クリーンアップなしに完了します。
- システムは実用的です。 スループット、受け入れ出力率、動作努力は利用可能な選択肢を打ちます。
実質的な決定は4番目のマイルストーンだけをサポートします。CPUオフロードはシステムRAMとPCIe転送に圧力をシフトさせます。量子化はメモリを削減しながら推論を遅くできます。VAE タイリングはメモリを保存しますが実行プロファイルを変更します。デスクトップGPUは容量の一部をディスプレイと他のアプリケーションに失います。
クローズドホストされたモデルは別カテゴリです。API または ComfyUI ノードは一般的なモデル名を暴露しながら全推論リモートで起こります。その区別の具体的例として、Seedanceをローカル実行できるかどうかの説明を見てください。
公正なローカルベンチマークは1午後かかります
大規模なプロンプトライブラリで始めないでください。異なる失敗モード暴露5プロンプトを使用してください。
- ロックされたカメラ1つの移動主体;
- 2人相互作用;
- 高速横方向モーション;
- 画像・動画で顔または製品が一貫保つ必要;
- テキスト、手、繰り返しジオメトリ含むシーン。
実際に出荷する解像度、期間、メモリ設定ですべてのモデルを実行します。記録:
| 指標 | なぜそれが重要か |
|---|---|
| ピークVRAM | ワークフローが実サービスと並行生存するかどうかを明かす |
| ピークシステムRAM | CPUオフロードの隠れたコスト表示 |
| コールドスタート時間 | サーバーレスワーカーと再起動キューに関係 |
| クリップあたり秒 | 容量決定、品質ではない |
| 10試行あたり受け入れクリップ | モーション、同一性、プロンプト失敗キャプチャ |
| 受け入れクリップあたりワット時間 | ローカル動作コストを比較可能にする |
| 手動介入 | 本番前に脆いパイプラインを暴露 |
シードとプロンプトを固定保ちます。1つのモデルがプロンプト書き換え必要なら、その書き換えを静かに良いプロンプト与えるのではなくパイプラインの一部として保存してください。
オープンウェイト動画モデル導入前
チェックポイントは1つのコンポーネントのみです。信頼できるローカルサービスは必要:
- ウェイト、キャッシュ、入出力、レンダリングフレーム向けに十分なNVMe スペース;
- NVIDIA ドライバ、CUDA、PyTorch、注意ライブラリ向けピンバージョン;
- 失敗ジョブ後GPU メモリを解放するワーカー;
- 期間、解像度、フレーム数、バッチサイズ向けリクエスト制限;
- 出力モデレーション、アップロード顔またはコピーライト資産向けポリシー;
- 必要な製品へ運ばれたモデルとライセンス通知;
- アップグレード向け再現可能ベンチマークプロンプト。
ビデオ拡散失敗は遅く来るため高コスト。ワーカーは返す前に何分か過ごす可能性メモリ不足エラーまたは不可使用クリップ。ジョブが生成キューに入る前に入出力検証・メモリ予約してください。
FAQ
12GB VRAM向けベスト開放ソースAI動画モデルは何ですか?
CogVideoX1.5-5Bは最もクリアなドキュメント選択肢です。公式モデルカードは10GB から最適化BF16 Diffusers パスと7GBからINT8パスをリストしています。両方メモリ節約技術に依存し、遅い可能性です。
RTX 4090向けベストローカル動画モデルは何ですか?
Wan 2.2 TI2V-5Bはこの比較の最佳出発点です。パブリッシャーは24GB単一GPU設定、24fpsでの720pクラス出力、テキスト・画像ベース動画両方サポートをドキュメント化します。
HunyuanVideo-1.5は16GB VRAMで実行可能ですか?
はい、Tencentのドキュメント公開14GB最小値によると、モデルオフロード有効。公式セットアップはLinux とNVIDIA CUDA GPU をターゲットします。利用可能システムRAMとストレージ速度依然体験に影響する。
Mochi 1は24GB GPUで実用的ですか?
公式22GB BF16 Diffusers例を使用し収まる可能性あり、品質低下記載。参照実装はより多くメモリが必要で、初期モデルは480pをターゲットするため、Wan 2.2 は通常より実践的な24GB選択肢。
これらのモデルを商用利用できますか?
答えはモデルに依存します。Wan 2.2 TI2V-5B と Mochi 1 は Apache-2.0 を使用します。HunyuanVideo-1.5はTencentコミュニティライセンスを、CogVideoX1.5はCogVideoXライセンスを使用します。正確なチェックポイント向けの現在ライセンス、受容可能使用ルール、領土、配布条件をレビューしてください。この記事は技術比較で、法的忠告ではない。
最小VRAM は生成速度を予測しますか?
いいえ。最小設定はCPUオフロード、タイリング、または量子化を通じメモリを通常保存し、すべてが速度を削減できます。ターゲットマシンでウォール時計時間と受け入れ出力を測定してください。
参考資料
- Wan-AI. Wan2.2-TI2V-5B model card and official repository. Weights, Apache-2.0 license, 720p output, 24GB command, and performance guidance. Retrieved July 30, 2026 from huggingface.co/Wan-AI/Wan2.2-TI2V-5B and github.com/Wan-Video/Wan2.2
- Tencent. HunyuanVideo-1.5 model card. Official 14GB minimum, system requirements, checkpoints, and output paths. Retrieved July 30, 2026 from huggingface.co/tencent/HunyuanVideo-1.5
- Z.ai. CogVideoX1.5-5B model card. Diffusers and SAT memory figures, quantization trade-offs, duration, and resolution. Retrieved July 30, 2026 from huggingface.co/zai-org/CogVideoX1.5-5B
- Genmo. Mochi 1 preview model card. Diffusers memory examples and lower-precision trade-off. Retrieved July 30, 2026 from huggingface.co/genmo/mochi-1-preview
- Tencent. Tencent Hunyuan Community License Agreement. Territory, distribution, commercial, and use terms. Retrieved July 30, 2026 from HunyuanVideo-1.5 LICENSE
- Z.ai. CogVideoX License. License linked from the official model card. Retrieved July 30, 2026 from CogVideoX1.5-5B LICENSE
- Genmo. Mochi repository. Hardware guidance, Apache-2.0 license, architecture, and documented limitations. Retrieved July 30, 2026 from github.com/genmoai/mochi
著者

カテゴリ
他の記事

Gemini 3.6 Flash の使い方:速度、料金、制限事項
Gemini 3.6 Flash の使い方:ベンチマーク、Luna と Sonnet 5 に負ける場面、API 4 つの破壊的変更、Flash-Lite と Cyber。


Higgsfield代替案:AI動画生成ツール・APIの比較
Higgsfield代替となるAI動画API・ツールを徹底比較。reAPI、Atlas Cloud、fal、Replicate、Krea、Dreaminaの特徴と料金を検証。


Seedance動画は何秒まで?2.0は15秒、2.5は30秒
Seedance 2.0は1回につき4〜15秒、Seedance 2.5は4〜30秒を生成します。長さの設定、現在の料金、シーンをつなぐ方法を解説します。
