RLR-0010 ・ 更新 2026/10/07

MiniMax H3が最大約2.8倍速く?RTX 4090でも効く『Veda』を初心者向けに整理

MiniMax H3の動画生成をSparse Attentionで高速化するVedaを、RTX 4090の開発元ベンチマークやComfyUIでの使い方、注意点とともに初心者向けに整理します。

✓ 公開前チェック済み最終確認 2026/10/07
MiniMax H3の動画生成高速化をRossyとLumiが研究するイメージ

MiniMax H3をローカルで使っている人に、かなり気になる高速化が出てきました。

名前は Veda Sparse Attention。

ざっくり言うと、MiniMax H3が動画を作るときに行っている大量のAttention計算から、「ここは重要そう」という部分を先に選び、必要なところを中心に計算する仕組みです。

開発元が公開しているRTX 4090の測定では、動画が長くなるほど効果が大きくなり、14.4秒の条件で端から端までの生成処理が約2.82倍になっています。

ただし、ここでいきなり「MiniMax H3が誰でも3倍速くなった!」と覚えるのは早いです。

この記事では、何が速くなったのか、ComfyUIでどう使うのか、そして数字を見るときにどこへ注意すればいいのかを、できるだけ専門用語をほどいて整理します。

まず結論

Vedaは、MiniMax H3の動画生成で重くなりやすいAttention計算を**疎にする(Sparseにする)**高速化技術です。

開発元が公開しているRTX 4090の16:9動画ベンチマークは次の通りです。

動画の長さAttention部分生成全体
5.17秒約4.75倍約1.77倍
10.1秒約6.22倍約2.42倍
14.4秒約6.31倍約2.82倍

ここで大事なのは、Attentionが6倍速くても、動画生成全体が6倍になるわけではないことです。

動画生成にはAttention以外の計算やモデルの読み書きなどもあります。そのため、私たちが実際に感じる待ち時間に近いのは右側の「生成全体」の数字です。

Rossy Laboratoryでは、この記事公開時点で同じ条件によるRTX 4090実機比較までは行っていません。上の数字は開発元が公開している測定値として紹介しています。

そもそも何を速くしているの?

生成AIでは、モデルがたくさんの情報同士の関係を調べるためにAttentionという計算を使います。

動画は画像より扱う情報量が大きくなりやすく、長くなるほどこの計算も重くなります。

Vedaの考え方はかなり大胆です。

すべてのAttentionを同じように計算するのではなく、小さな予測器で「重要そうな場所」を先に見つけ、開発元のMiniMax H3設定では約10%のAttentionを残して計算し、残りの多くをスキップします。

😺「100個ぜんぶ確認するんじゃなくて、大事そうな10個を先に絞る感じ?」

だいたいそんなイメージです。

もちろん実際の仕組みはもっと複雑ですが、初心者がVedaの役割を理解するなら「全部を力ずくで計算しない」が入口になります。

RTX 4090で最大約2.8倍

今回特に気になるのが、RTX 4090の数字です。

開発元のMiniMax H3用Vedaモデルカードでは、16:9の5.17秒動画で生成全体約1.77倍、10.1秒で約2.42倍、14.4秒で約2.82倍とされています。

長い動画ほどAttentionの負担が大きくなるため、Vedaの恩恵も大きくなっているのが見えます。

ただし、これは特定のモデル、設定、実装で測定された数字です。

「RTX 4090ならどんなMiniMax H3ワークフローでも2.82倍」と保証する数字ではありません。

12GBのRTX 5070でも大きな差

ComfyUI向けVedaノードの開発元は、Windows 11とRTX 5070 12GBでも実測結果を公開しています。

1344×768、124フレーム(約5.2秒)、8-step Turbo LoRAという条件では、生成全体が次のようになっています。

Attention設定8ステップ合計
ComfyUI標準約342秒
SageAttention約231秒
Veda sparse INT8約130秒

標準の約342秒から約130秒なので、この測定では約2.63倍相当の短縮です。

なお開発元READMEでは別の集計・丸め方で2.9倍と表現されています。この記事では、公開されている実測表そのものも併記し、342÷130の単純比は約2.63倍として扱います。

ただし、12GBなら長い動画も何でも快適になる、という意味ではありません。

開発元の追加検証では、14.4秒相当の大きな条件は12GB環境で重量の入れ替えが支配的になり、非常に遅くなるケースも報告されています。

Vedaは「VRAMそのものを魔法のように増やす技術」ではない点には注意が必要です。

VedaはLoRAなの?

Vedaは、画風やキャラクターを学習させるLoRAとは役割が違います。

ComfyUI版では、モデルのAttention計算へ割り込むattention overrideとして動作します。

そのため開発元は、Turbo LoRAやスタイルLoRA、微調整済み・量子化済みのH3モデルなどと組み合わせられると説明しています。

つまり、Turbo LoRAでステップ数を減らし、VedaでAttention計算を減らす、というように別方向の高速化を組み合わせられる可能性があります。

ComfyUIで使える?

使えます。

開発元はVeda-on-ComfyUIを公開しており、ComfyUI 0.38.0以上を要件としています。

ComfyUI Managerで「Veda」を探すか、Comfy CLIからVeda Sparse Attentionノードを導入できます。MiniMax H3向けにはT2VAとR2VAのサンプルワークフローも用意されています。

既存ワークフローへ追加する場合は、基本的にモデルやLoRAの後、guider / samplerの前のMODELラインへVedaノードを入れる形です。

ここは注意

開発元は、MiniMax H3でComfyUI標準の Model Sparse Attention とVedaを同時に使わないよう注意しています。

Model Sparse Attention側がAttention block自体を置き換えるため、Vedaが呼ばれなくなるからです。

一方、SageAttention系やLow VRAM系ノードについては組み合わせ方も検証されています。既存の高速化ノードを大量に積んでいる人ほど、「とりあえず全部ON」ではなく開発元READMEの組み合わせ説明を確認した方が安全です。

画質は落ちないの?

ここは慎重に見たいところです。

VedaはAttentionの大部分をスキップするため、「そんなに飛ばして映像は大丈夫なの?」という疑問が当然出ます。

開発元は、重要なAttentionを予測して残すことで品質を保ちながら高速化する設計を説明しています。

ただしRossy Laboratoryでは、同一seed・同一設定でVeda ON/OFFの画質比較をまだ行っていません。

そのためこの記事では、「画質劣化なし」と断定はしません。

速度だけでなく、キャラクターのIdentity、動き、音声、細部などが同程度に維持されるかは、実際のワークフローで確認する価値があります。

すべてのGPUで同じように速くなる?

なりません。

速度差はGPU世代、動画の長さ、解像度、Attention実装、量子化、オフロード、VRAM容量、他の高速化ノードなどで変わります。

ComfyUI版の開発元情報では、NVIDIAはSM80以降向けのTritonコードパスが用意され、RTX 5070で実機検証されています。RTX 30/40系などはコードパスが用意されていますが、READMEのハードウェア表では未検証とされている構成もあります。

一方、Veda本体のMiniMax H3モデルカードにはRTX 4090のベンチマークが掲載されています。

「4090の数字がある」ことと「ComfyUIノードの全構成が4090で検証済み」ことは分けて考えるのが安全です。

MiniMax H3、今度は「速くなった」

MiniMax H3周辺は、モデル本体だけでなく、その周囲の最適化もかなり速いペースで進んでいます。

メモリ使用量を減らす改善、VAEまわりの改善、量子化、少ステップLoRA、そして今回のSparse Attention。

ローカル生成AIでは、新モデルが出た瞬間の性能だけでなく、数日後・数週間後に周辺ツールがどこまで軽く速くしてくれるかもかなり重要です。

特に動画生成は1回の待ち時間が長いため、2倍前後の高速化でも体感差は大きくなります。

初心者が覚えておきたい3つ

  1. VedaはMiniMax H3のAttention計算を減らして高速化する技術
  2. RTX 4090では開発元測定で生成全体最大約2.82倍。ただし条件依存
  3. ComfyUIで利用できるが、他のAttentionノードとの組み合わせには注意

「新しいモデルが出た」だけでなく、「今使っているモデルが急に速くなった」もローカルAIでは大きなニュースです。

MiniMax H3をすでに使っている人ほど、Vedaはチェックしておきたい高速化のひとつです。

参考

この記事は、Veda開発元が公開しているMiniMax H3用モデルカード、Veda-on-ComfyUI README、ハードウェア検証記録を中心に整理しました。

速度は環境とワークフローで変わります。Rossy Laboratoryで同条件の実機比較を行った場合は、開発元測定と区別して追記します。

SOURCES

確認した情報源