見出し画像

ローカル生成で、くるっと着替え動画にチャレンジ(Z-Image/Wan2.2/VACE Clip Joiner/LTX-2.3 Upscaler)

しばらく前から X(旧Twitter)で流れてきたAI動画を見て「おっ」と思ってたんですよ。360°回転したら次々と別コスプレに着替えていく動画。瞬間的に、「これをローカル生成で作るとしたらどうすればいいだろう?」と考えた。基本、Wan2.2で動画化するとしたら、今の環境では解像度的に全体をいっぺんに生成するのは絶対無理だ…と。
その動画は、右側にキャラクターがいて、左側にファッションアイテムが商品陳列されてるような画面でした。これ全部は、720ptの中に収めるとつぶれてしまう。なので、タイトルとキャラ部分だけ作ってみようと思い、チャレンジしてみました。

幸いにも、そのXでは、画像生成と動画生成のためのプロンプトが書かれてたので、それを参考にさせてもらいました。

結果、やったことの一覧は下記の通り。

  1. Z-Image-turbo を使って、ポーズを取っているキャラクターの画像を生成(3種類)。

  2. 上記3枚から、そのキャラ的な動きの5秒動画を生成(Wan2.2 FLF2V で、開始と終了の画像を同じにして実行)

  3. 上記3枚から、次のキャラへの回転して遷移する5秒動画を生成(Wan2.2 FLF2V で、開始キャラと終了キャラを別にして実行)

  4. 回転遷移動画を、ffmpeg を使って5倍速に変換(5秒で1回転してたのを1秒で1回転に変える)。

  5. 上記2~4で生成した6動画を、LTX-2.3 Upscaler で1.5倍にアップスケール。

  6. 上記6動画の間を、Wan VACE Clip Joiner で補完しつつ連結していく。

  7. 完成した動画に、編集ソフトで音楽をつける(回転中は音の再生速度を上げる処理/音楽にあわせて動画再生速度も調節)

まあ、テストなので、多少のアーティファクトが出ていても何度もガチャ生成することもなく、動きが変じゃなきゃオッケーという緩い基準で生成していきます。「コスプレ 人気」で画像検索して出てきたのからチョイスして、見たまま日本語に落としてプロンプト化して画像生成。まったく既存キャラと同じなのはアレなので、ちょっと変えました。初音ミクは確か、商用以外なら使用していいはずなので、ほぼまんま使いましたが。

生成した画像(Z-Image-turbo)

やってみてわかった問題点。
・元動画でアーティファクトが出てしまったものは、LTX-2.3 Upscalerでもキレイにはならない。
・LTX-2.3 Upscaler を使ったら、なぜか残像が乗ってしまった(設定の問題?)。
・開始/終了画像がしっかりポーズしてるので、Clip Joinerでポーズを飛ばされる場合もあった。

では、完成品です。画質を落としたGIF画像を貼り付けて、音楽付きのショート動画のリンクも貼っておきます。
画質の悪さはありますが、まあ一応やりたかったことは実現できてるかなと思います。LTX-2.3でより良い画質で生成してみる手はあるんですが、ただでさえプロンプトで書いた事が通じてくれないLTXで迷宮入りするのは避けたかったので、そっちはチャレンジしてません。

GIF画像(縮小版)


いいなと思ったら応援しよう!