見出し画像

Flow Music リリックビデオ用の10秒動画をFlowの代わりにMiniMax H3で制作

Flow Musicで生成した曲のリリックビデオ制作用の10秒動画を生成するのに従来使っていたGoogle Flowのクレジットが切れて使えないので、代わりにFal.AIのMiniMax H3で生成してみたので紹介します。

★ 以下の記事で詳しく説明しているように、MiniMax H3で制作した動画をSNSやYouTubeなどにアップすると、現状ではライセンス上の問題を引き起こす可能性があるので、使うのを止め、すでにアップ済みの動画も順次削除しています。


Flow Musicで生成した曲

モチーフにした曲

2000年代によく聴いていた柴田淳の「月光浴」などをモチーフにした、今回の曲のコンセプトをGeminiに伝えて、Flow Music用のプロンプトを生成してもらいました。

サウンドと歌詞

Flow Musicで生成した曲のサウンドと歌詞は以下です。

SOUND:
Japanese Pop, Melancholic Pop Ballad, Sophisti-Soul, Quiet Storm, smooth Fender Rhodes piano, warm fretless bass, soft brushed drums, expressive saxophone, emotional female vocal, intimate nocturnal atmosphere, mid-tempo groove, 86 BPM, A minor

Lyrics:
[Intro]
(Ahhh...)

[Verse 1]
夜空に浮かんだ
細い下弦の月
あなたの横顔
見つめては目を閉じる
胸の痛みに
名前はつけないの

[Chorus]
好きじゃない 好きじゃない
自分に嘘をつく
傷つくのが怖いだけ
夜風に隠した恋心
切なく揺れてる
(揺れている)

[Verse 2]
触れそうな指先
わざと少し引いた
優しい言葉ほど
刃にかわるから
強がりな笑顔で
夜を見つめている

[Chorus]
好きじゃない 好きじゃない
何度も繰り返す
届かないこの想い
冷たい月だけ知っている
涙を隠して
(隠して)

[Bridge]
抱きしめられたら
すべて壊れてしまう
ほんとは抱きしめてほしいのに
素直になれない

[Chorus]
好きじゃない 好きじゃない
自分に嘘をつく
本当は愛してる
夜風に解けた恋心
あなたに届けたい
(届けたい)

[Outro]
月が照らす夜
(好きじゃない)
素直になれなくて
(愛してる)
さようなら
(Ahhh...)

生成した曲

Flow Musicが生成した曲のプレビューは以下です。(MP3)

★ タイトルに (Cover)がついているのは、漢字を間違えて発音するので、間違えた漢字をひらがなに書き直し、Flow MusicのCover機能で再度生成し直したからです。動画の字幕は元の漢字を使います。

MiniMax H3で10秒動画を生成

自作のD'zGAL Music Webアプリでリリックビデオを出力するために必要な2本の10秒動画を、Google Flowがクレジット不足で使えなかったので、代わりにMiniMax H3を使ってみました。

★ FlowのOmniは最大10秒までしか動画生成ができませんでしたが、MiniMax H3では最大15秒まで生成が可能なので、イントロ/エンディング用の動画は、歌い出しの時間調整のために13秒で生成しました。

Fai.AI MiniMax H3

MiniMax H3はオープンウェイトモデルなので、通常は高性能なローカルPC上で動かしますが、手持ちのPCではスペック不足で動かせなかったので、従量制課金のFal.AIの以下のMiniMax H3をプレイグラウンドで使用しました。

★ 「Reference to Video」では、複数のキャラクター画像(顔、服装)をアップロードして、プロンプトにより比較的自由に動画シーンを構成できます。

Fal.AI > MiniMax H3 Reference to Video

★ Fal.AIは使った分だけ支払う従量制課金方式なので、今回の場合は1回の動画生成で約2ドル分消費されます。

イントロ/エンディング用 動画

イントロ/エンディング用13秒動画の生成結果

使用したプロンプトは以下です。

添付画像1の若い日本人女性歌手はセーラー服(添付画像2の衣装)を身にまとい、ミュージックビデオの撮影を開始しようとしています。

彼女は学校の裏手にある薄暗い廃倉庫におり、背後にはサックスを中心としたモダンジャズバンドが控え、手前にはShure(シュア)製のスケルトン・マイクが配置されています。

彼女はマイクに歩み寄ってその前で深く息を吸い込み、「お願いします」と口にすると、マイクに手を添えて目を閉じ、静止します。

カメラは、彼女の上半身が映るまで待ってから、ゆっくりドリーアウトします。

今回は768pの解像度で生成しましたが、最大4Kまで生成が可能です。

参照画像 > 顔と服装

参照画像は以下の2枚をアップロードしました。

参照画像 > 顔
参照画像 > 服装

★ Google Flowのキャラクター用に用意した画像をそのまま流用しました。顔画像はDAZモデルですが、服装はFlowの画像生成でプロンプトにより従来の服装画像(のっぺらぼう版)をセーラー服に変更しました。

ループ用 動画

ループ用10秒動画の生成結果

プロンプトは以下です。

添付画像1の若い日本人女性歌手はセーラー服(添付画像2の衣装)を身にまとい、ミュージックビデオの撮影を開始しています。

彼女は学校の裏手にある薄暗い廃倉庫におり、背後にはサックスを中心としたモダンジャズバンドが演奏を始めていて、手前にはShure(シュア)製のスケルトン・マイクが配置されています。

彼女はマイクに手を添えて目を閉じたままで100BPMのスローテンポで歌い始めます。

カメラは、彼女の上半身を中心に、ゆっくり左右にドリー回転しながら彼女のバストアップに寄ります。

歌詞は以下です。
「そらにうかんだほそいかげんのつきあなたのよこがお」

★ ある程度リップシンクを意識して、曲と同じ歌詞を歌わせていますが、タイミングはBPMと動画の長さで調整します。歌い出しのタイミングは、イントロ/エンディング用の動画の長さで調整します。

D'zGAL Musicでリリックビデオ化

D'zGAL Music 開始画面

素材ファイルの読み込み

曲(MP3)、イントロ/エンディング用動画(MP4)、ループ用動画(MP4)、歌詞(テキスト)の4つの素材ファイルを読み込みます。

素材ファイルを読み込む

再生」をクリックし、4つの素材ファイルが結合された動画のプレビューを確認します。

歌詞のタイミングを記録開始

歌詞のタイミングを記録

タイミングを記録する」をクリックし、歌詞の冒頭のタイミングでスペースキーを押します。(間違えたら、スペースキーの上にある「B」キーまたはバックスペースキーを押すことで、1段階戻れます)

歌詞のタイミングを記録中

終わったら「保存」をクリックして、タイミング入りの歌詞を保存しておきます。(「全消去」をクリックすると、タイミングを消去できます)

タイミングの記録終了

リリックビデオを書き出し

再生」をクリックし、歌詞入りのプレビューで確認後、「書き出しを開始」をクリックすると、1曲分の歌詞入りのリリックビデオを生成しファイル(MP4)に書き出します。

音量とレイアウトの調整」を開くと、各種オプション設定ができます。

音量とレイアウトの調整を開いたところ

★ 私の場合は、「歌詞の高さ」を今回は「60%」に変更しています。これにより、インスタグラムに投稿したリール動画の下の部分の文字と重ならないようにしています。

作例

インスタグラムのリールに投稿した動画の作例が以下です。

インスタグラムへの投稿スクリーンショットは以下です。

インスタグラムへの投稿スクショ - その1
インスタグラムへの投稿スクショ - その2

★ 私の場合は、インスタグラムなどにミュージックビデオを投稿するのは初めてなので、使い勝手がわからず、同じ曲を複数回投稿して試しています。

まとめ

Flow Musicで生成した曲のリリックビデオ制作用の10秒動画を生成するのに、今回は従来使っていたGoogle Flowの代わりに、Fal.AIのMiniMax H3で生成してみたので紹介しています。

Fal.AIは従量制課金方式であり、今回の1回の動画生成に約2ドル消費される一方で、Google Flowだと、私の場合はGoogle One AI Proプランに加入しているので、毎月1000クレジットプラス毎朝50クレジットが付与されます。

このクレジットを使うと、1回の動画生成はほぼ15クレジットの消費で済むので使わない手はないのですが、現在はクレジットが底をつき、次回のチャージまで待たないと毎朝の50クレジットで1日3回までしか使えません。

一方で、動画に使う素材画像によっては、私の場合はGoogleのポリシー違反によりFlowでの画像や動画の生成ができないことがけっこうあるので、今回使ったMiniMax H3ではそれが今のところ無かったり、生成スペックが高い(最大15秒、4Kなど)などのメリットを感じました。

今後は、ケースバイケースで両者を使い分けしつつ、総合的な経済効率の良い動画生成について検証したいと思います。

今後は、Google Flowと、クレジットが不足する場合は、Fal.AIのOmni Flashを使うことにしました。

これは「reference to video」モデルなので、例えば、Flowのキャラクター登録に使った顔画像とキャラクターシート画像、および、シーンの説明に使うワイドショットの画像など、複数の画像をアップロードすれば、image to videoモデルより遥かにプロンプトの自由度が高くなります。

私の場合は、Omni Flashが生成する動画の人物(顔立ち)が好みに合っているような気がしています。ちなみに、10秒の生成で約$1.3と、MiniMaxやLTX2.5などより安いし、生成時間も1分程度と高速です。

作例

これの生成に使用した画像は以下です。

DAZモデルをレンダリング(Flow キャラクター用)
DAZモデルをレンダリング(Flow キャラクター用)
Flowでプロンプト画像生成(上記2枚の画像をキャラクターに登録後)

3DCGアプリを使うのは、生成AIよりたいへんですが、自分のイメージを形にするには、慣れている3DCGアプリの方が近道に感じます。

参考リンク


いいなと思ったら応援しよう!