RLR-0015 ・ 更新 2026/10/10

MiniMax H3でリアルタイム動画生成?ComfyStreamerH3がRTX 5090一枚で挑んだこと

ComfyStreamerH3はRTX 5090一枚で15秒動画を15秒以内に生成することを目指す実験。448×256、4ステップ、VRAM30GB未満という条件と、RTX 4090での注意点を初心者向けに整理。

✓ 公開前チェック済み最終確認 2026/10/10
RossyとLumiがRTX 5090一枚によるMiniMax H3のリアルタイム動画生成実験を解説する図

まず結論:動画生成が「再生速度」に近づく実験

動画生成AIは、5秒の映像を作るために何分も待つことがあります。ところが2026年10月8日、ComfyUIの公式ブログにMiniMax H3を使って、15秒の動画を15秒以内に作ることを目標にした実験が掲載されました。

名前はComfyStreamerH3。ポイントは、クラウドの巨大なGPU群ではなく、RTX 5090を1枚だけ使う構成です。

😺「15秒の動画が15秒でできたら、もうライブ配信みたいに使えるの?」

🐈‍⬛「目指しているのはそこ。ただし、画質や解像度に大きな妥協があるし、どんなPCでも動く話ではないよ」

この記事は開発者の公開情報を整理したものです。Rossy Laboratoryで実機再現した検証記事ではありません。

「リアルタイム」の意味を整理しよう

今回の目標は、15秒分の動画を15秒以下で生成すること。これは生成速度が動画の再生時間に追いつくという意味です。

ただし、ここでいう「ライブ」は、一般的なカメラ映像と同じ遅延ゼロの双方向配信を保証する言葉ではありません。初回の待ち時間、連続したクリップのつながり、品質の安定性などは別の問題です。

公式記事で設定された条件は次のとおりです。

項目開発者の目標・構成
GPUNVIDIA RTX 5090 × 1
VRAM32GB
動画の長さ15秒
生成目標15秒以内
解像度448×256
画質方針多少の破綻を許容し、視聴可能な映像を目指す

特に重要なのが448×256という解像度。フルHD(1920×1080)より画素数がずっと少ないため、普通の高画質動画生成と同列に比較してはいけません。

何を工夫して高速化したの?

公式記事では、ひとつの魔法のような技術ではなく、複数の軽量化を組み合わせています。

1. 生成ステップを4回に減らす

画像や動画を少しずつ整える計算を4ステップに削減。今回はFastVideoのFastH3 V2チェックポイントを使用しています。計算は減りますが、画質への影響も考慮が必要です。

2. Sparse Attentionで計算量を抑える

Attentionは、動画の各部分がほかの部分とどう関係するかを扱う仕組み。ここではVSAによって一部のブロックに重点的に注意を向け、すべてを同じ密度で計算しない方式を採用しています。公式記事では、動画ブロックの約20%にフルAttentionを適用すると説明されています。

3. テキストエンコーダーを小型化

通常の大きなテキストエンコーダーの代わりに、Qwen3-VL-4Bを使うClipProj構成を採用。開発者によると、エンコーダーのメモリ使用量は約15.7GBから約4.5GBへ下がります。

4. モデルと計算をさらに軽量化

枝刈り(pruning)とINT8化を組み合わせたチェックポイントに加え、FP4を使う融合MLPも活用。モデルの重みや一時データに必要なメモリを減らします。

5. 動画の復元と保存を並行処理

生成された潜在表現を映像に戻すVAEデコードでは、Kijai氏のINT8動画デコーダーを利用。タイル単位のデコードとNVENCによる動画エンコードを重ね、前の処理が全部終わるのを待たずに次へ進めます。

これらの組み合わせによって、公式記事では必要VRAMを80GBから30GB未満へ抑えたと説明されています。

RTX 4090(24GB)でも動く?

ここは気になるところですが、今回の公開実験をそのままRTX 4090で再現できるとは確認されていません。

開発者の構成はRTX 5090の32GB VRAMを前提とし、最適化後もVRAM使用量は30GB未満です。「30GB未満」は「24GB以下」を意味しません。

さらに、GPUの演算性能やFP4関連の最適化も異なります。RTX 4090で15秒を15秒以内に生成できるという公式測定値は、この記事で確認した一次情報にはありません。

😺「じゃあ、4090を持っていたらすぐ試すべき?」

🐈‍⬛「まだ実験的な構成。まず必要VRAMと対応GPUを確認して、既存のComfyUI環境を壊さない方法を考えたいね」

画質はどうなの?

公式ブログにはアニメ調、スタイライズされた3D、水彩風の例が掲載されています。一方、開発者自身がディテール、映像の一貫性、解像度には改善の余地が大きいと認めています。

つまり、今回の成果は「高画質な動画生成が誰でもリアルタイムになった」というニュースではありません。

低解像度・軽量化・画質とのトレードオフを受け入れることで、単一GPUで動画再生速度に近づける可能性を示したことが重要です。

試してみたい人はどこを見る?

公開実装はComfy-OrgのGitHubにあります。開発背景やデモはComfyUI公式ブログを参照してください。

ただし、既存のMiniMax H3ワークフローにノードをひとつ足せば同じ速度が出るわけではありません。 特定の軽量化モデル、GPU、依存ライブラリ、動画の解像度を含む実験条件がセットになっています。導入前にリポジトリの最新READMEとライセンスを確認しましょう。

まとめ:完成形ではなく、次の可能性を示した実験

ComfyStreamerH3は、MiniMax H3による動画生成を**「待って完成させる」から「再生速度に近づける」**方向へ押し進める取り組みです。

RTX 5090一枚、448×256、4ステップ、VRAM30GB未満。こうした条件を明示して見ると、成果の大きさと制約の両方が分かります。

今後は画質改善、長い動画の一貫性、より少ないVRAMへの対応が進むかに注目したいところです。Rossy Laboratoryでも、実機で確認できた段階では条件を分けて報告します。

SOURCES

確認した情報源