LTX-2.3の派生モデル その1「Sulphur 2」でリップシンク動画生成

ComfyUIを使用して、LTX-2.3の派生モデル「Sulphur 2」でリップシンク動画を生成してみました。

Sulphur 2の入手先はこちらです。


Sulphur 2用のワークフローを添付します。
入力画像をスタートフレームにして動画を生成する、I2V(Image to Video)です。
LTX-2.3のI2V用ワークフローをベースに、Sulphur 2のモデルと、Distilled LoRAをSulphur 2用に差し替えています。


モデルのダウンロードリンクと、ダウンロードしたファイルをどのフォルダに配置するかは、ワークフローの「Model Links」に記載しています。
プロンプトエンハンサーは無効に(バイパス)しています。

2026/6/14 追記
添付のワークフローのtext encoderは「gemma_3_12B_it_fp8_scaled.safetensors」を使用しています。
「gemma_3_12B_it_fp4_mixed.safetensors」に変えると、メモリ使用量が減りますので、処理が重いと感じる場合はお試しください。


添付のワークフローで、実際に生成した動画はこちらです。

※ChatGPTで生成した架空の人物です


Sulphur 2で生成した動画は、意味不明な字幕が出る現象が多発します。
ベースになっているLTX-2.3は、試した限りでは字幕が出ることはありませんでしたが、Sulphur 2は高確率で字幕が出ます。

字幕が出ないように、ネガティブプロンプトに禁止ワードが入っているのですが、あまり効いてないようです。

今のところ、ノイズシードをrandomizeにして、シードガチャで字幕が出ない動画が生成するまで、やり直すしかなさそうです。

字幕が出ない当たりのシードが見つかったら、メモしておいて、後で動画を生成する際にシードとして設定すると、字幕が出にくくなります。

以前は、GoogleのVeo 3でも、意味不明な字幕が多発しました。
原因は、字幕が書かれている動画を学習データに多く使用して、字幕を映像の一部として学習してしまったために、生成された動画にも字幕が出るということでした。

Sulphur 2が同じ原因かは不明ですが、似たような感じに見えます。

その後Veoは、学習データにする動画の字幕入りのフレームを削除したり、改善されて、意味不明な字幕が出ることはなくなりました。

Sulphur 2は、検閲無し(uncensored)ということを売りにしています。
実際に試してみた感じでは、確かにNSFWな動画の描写は、LTX-2.3よりもクオリティがアップしています。
あまり詳しくは書けませんので、読者様ご自身でお試しください。


2026/6/25 追記
チャッピーさんとやりとりをして、ショート動画は字幕が出やすいということが分かりました。
プロンプトで「ホームビデオ」だと指示することで、字幕がほぼ出なくなりました。
意味不明な字幕が出てお困りの際は、プロンプトの最後に、以下の指示を追加してみてください。

Clean natural live-action home video.
Raw ordinary camera footage.
The frame stays simple, realistic, and uncluttered.
Natural realistic movement and ordinary home-video visual style.

字幕を出さないようにと考えて、以下のような指示を追加すると、「no」が無視されて、逆に字幕が出る方にプロンプトが効いてしまいますので、ご注意ください。
no subtitles
no captions
no on-screen text


ベースになっているLTX-2.3について、こちらもご覧ください。


いいなと思ったら応援しよう!