クリエイティブ実践ガイド

ComfyUIでWan 2.2のimage-to-videoを始める方法|最初のI2V動画まで

ComfyUIでWan 2.2のimage-to-videoを始める方法 — 最初のI2V動画まで
目次
公式

公式ページで入手・手順を確認

ComfyUIでWan 2.2のimage-to-video(I2V)を始めるときは、最初から複雑な省メモリ構成や大量の追加ノードを入れるより、公式テンプレートで短い動画を1本出すところを基準にすると原因を切り分けやすい。

I2Vは、1枚の画像を開始条件として動画を生成する方式だ。本稿では「Wan 2.2で最初のI2V動画を出す」ことだけに絞る。

ComfyUIでWan 2.2のimage-to-videoを始める方法|最初のI2V動画までの要点を図解

図を拡大して見る

図: 処理や設定の流れを1枚に整理。実際の操作条件は本文で確認する。

まず公式I2Vテンプレートを読み込む

ComfyUIにはWan 2.2向けの公式ワークフローが用意されている。

最初はそのテンプレートをそのまま読み込み、ノードを削除したり別のカスタムノードへ置き換えたりする前に、何が必要なのかを確認する。

Wan 2.2の動画生成は、1個のCheckpointファイルだけで完結する構成とは限らない。ワークフローによって、動画モデル、テキストエンコーダー、VAEなどを別々に読み込む。

まず次を控える。

ワークフロー・テンプレートのリビジョン:
動画モデル:
テキストエンコーダー:
VAE:
そのほか必要な構成:
ComfyUIのバージョン:

「Wan 2.2のモデルを入れたのに動かない」ときも、この一覧があれば不足しているものを追いやすい。

入力画像は生成条件の一部として残す

I2Vでは、開始画像そのものが生成条件になる。

同じプロンプトでも入力画像を変えれば比較条件は変わるため、最初の動作確認では毎回画像を変えない。

まずは、人物や背景の動きが複雑すぎない画像を1枚選び、そのファイルを保存しておく。

確認したいのは次の3点だ。

  • ワークフローが入力画像を正しく読み込めている
  • 画像の縦横比や解像度が、ワークフロー内でどう扱われるか確認できる
  • 最後の動画出力まで処理が進む

画像、プロンプト、解像度、フレーム数を一度に変えると、失敗したときに原因が分かりにくくなる。

最初は短い条件で動作確認する

動画生成では、解像度とフレーム数が変われば処理量も変わる。

そのため、「このGPUなら何秒で終わる」「VRAMは何GBあれば足りる」といった数字を、条件を示さずに当てはめない方がよい。

最初は短い動画にして、条件を固定する。

入力画像: 固定
解像度: 固定
フレーム数: 固定
seed: 保存
プロンプト: 保存
精度: 保存
オフロード設定: 保存

まずこの条件で1本生成し、成功してから解像度かフレーム数のどちらか一方だけを増やす。

オフロードはVRAMを「不要にする」機能ではない

メモリ不足を避けるために、モデルの一部をCPU側へ移すオフロードを使うことがある。

これはGPUメモリの使い方を変える方法であり、必要な計算やメモリそのものが消えるわけではない。設定によってはシステムRAMの使用量や処理時間にも影響する。

したがって、「オフロードできるから低VRAMのGPUでも必ず問題ない」とは考えない。

自分のワークフローで、

VRAM使用量:
システムRAM使用量:
生成時間:

を確認しながら調整する。

PC全体のメモリ構成を考えたい場合は、画像・動画生成PCのRAMは32GB・64GB・128GBのどれを選ぶ?も参考になる。

動画が出たら、成功条件をまとめて保存する

最初の動画が生成できたら、出力ファイルだけを残して終わらせない。

少なくとも次を一緒に保存する。

入力画像:
ワークフローJSON:
モデルID・リビジョン:
解像度:
フレーム数:
プロンプト:
seed:
精度・量子化:
オフロード設定:
出力ファイル:

これがあれば、次に設定を変えたとき「何を変えた結果なのか」を追いやすい。

また、ComfyUIやモデルを更新した後に、以前の条件を再現できるか確認する基準にもなる。

最初の1本が出てから最適化する

最初から量子化、複数LoRA、追加のカスタムノード、長いフレーム数などを同時に入れると、動かなかったときに戻る場所がなくなる。

まずは、

  1. 公式I2Vテンプレートを読み込む
  2. 必要なモデル構成をそろえる
  3. 入力画像を固定する
  4. 短い条件で1本生成する
  5. 成功した条件を保存する

という順で基準を作る。

その後に、メモリ削減、長尺化、画質調整を一項目ずつ追加する方が、問題が起きても原因を追いやすい。

T2VとI2Vのどちらを使うべきか迷っている場合は、ローカル動画生成はtext-to-videoとimage-to-videoのどちらを選ぶ?で用途の違いを先に整理できる。

まとめ

  • 最初はComfyUI公式のWan 2.2 I2Vテンプレートを基準にし、独自ワークフローや追加機能は後から足す
  • 動画生成では複数のモデル構成を使う場合があるため、ワークフローが要求するファイルを一つずつ確認する
  • 必要VRAMや生成時間は解像度、フレーム数、精度、オフロード条件で変わるため、条件なしで断定しない
  • 最初は短い動画で動作確認し、成功したワークフロー、モデルのリビジョン、入力画像、生成条件を一緒に保存する
同じテーマから

サイト内検索