見出し画像

【JoyAI Image Edit Plus】画像編集AIをComfyUIで1枚絵編集 全11パターンを試してみた

こんにちは、かみもとです!

本当に最近は色々な生成AIがリリースされて、手が回りません。。

今回は、画像編集モデルの JoyAI Image Edit Plus をローカルのComfyUIで動かして、色々な編集を試してみました!

表情や髪型を変えるような1画像編集だけでなく、人物と背景、服、バッグの合成、赤枠を使った位置指定、3画像を使った合成まで、色々なケースとトライしてみました。

ただ、画像が多くなってしまったので、記事を分割しています。今回は1枚絵の画像編集のみ。続きは次回以降で!

結果画像がかなり多くなりましたが、せっかくなので全部載せていきたいのでね。

各項目は、次の順番で掲載しています。

  • 実際に使用したプロンプト

  • 元画像・参照画像・変換後画像を並べた比較画像

  • 変換後画像の拡大版

  • 画像についての考察

JoyAI Image Edit Plusとは?

JoyAI Image Edit Plusは、JD.comのオープンソースチームが公開している、指示ベースの画像編集モデルです。元画像に対してプロンプトで指示して編集する、という使い方です。

1枚の画像を文章で編集できるだけでなく、複数の参照画像から人物、背景、服、小物、ポーズなどを取り出して、1枚の画像にまとめられるのが大きな特徴です。

さらに、赤枠をつけて「この赤枠で囲った部分に人物を移動」ということもできます。面白いですよねー。

公式モデルカードによると、構成は次の通りです。

  • テキスト・画像理解:Qwen3-VL-8B-Instruct(8B)

  • 画像生成Transformer:JoyImageEditPlusTransformer3DModel(16B)

  • VAE:AutoencoderKLWan

  • ライセンス:Apache-2.0

モデルの概要やDiffusers版のコードは、以下の公式ページで確認できます。

今回は、ComfyUIで扱いやすいINT8 ConvRot版を使いました。

導入方法

今回使ったのは、Windows版のComfyUI Portableです。

検証環境のComfyUIはすでにJoyAIへネイティブ対応していたため、カスタムノードは追加していません。また、今回の検証のためにComfyUI本体を更新することもしていません。もし使えない場合はComfyUIを最新版に更新すると良いです。

INT8 ConvRot版では、次の3ファイルを使いました。合計で約24.9GBです。

1. 画像編集モデル

`joyai_image_edit_plus_int8_convrot.safetensors`(約15.30GB)

保存先:

ComfyUI/models/diffusion_models/

diffusion_modelsダウンロードページ

2. テキストエンコーダ

`qwen3vl_8b_joyimage_edit_plus_int8_convrot.safetensors`(約9.37GB)

保存先:

ComfyUI/models/text_encoders/

text_encodersダウンロードページ

3. VAE

`wan_2.1_vae.safetensors`(約0.24GB)

保存先:

ComfyUI/models/vae/

VAEダウンロードページ

ファイル配置後にComfyUIを起動し、公式ワークフローを読み込めば準備完了です。公式ワークフローがBF16モデルを参照している場合は、各LoaderノードでINT8 ConvRot版へ変更します。

今回の主な生成設定は以下です。VRAM 12GBのRTX4070でもこれで画像編集できました。

  • 解像度:832×1216

  • Steps:30

  • CFG:4.0

  • Sampler:euler

  • Scheduler:normal

  • VAE:wan_2.1_vae

バッチ制御用のスクリプトはプロジェクト専用のvenvから実行し、普段使っているグローバルPython環境は変更していません。

実行環境

  • OS: Windows11 Pro

  • CPU: Core i3 12100F

  • MEM: DDR4 48GB

  • GPU: RTX4070 12GB

1画像編集

最初は、1枚のキャラクター画像と文章だけを使った編集です。

1. 表情を悲しくする

プロンプト

Change only her facial expression to a clearly sad and slightly worried expression with subtly furrowed eyebrows and a downturned mouth. Preserve her exact identity, eyes, hairstyle, hair color, outfit, pose, classroom background, composition, anime style, and lighting.
(彼女の表情だけを、眉をわずかに寄せ、口元を下げた、明らかに悲しげで少し心配そうな表情に変えてください。本人であること、目、髪型、髪色、服装、ポーズ、教室の背景、構図、アニメ調のスタイル、そして照明はそのまま維持してください。)

比較結果(元画像と変換後)

変換後画像

考察

悲しいというか困り顔かもしれません。ただ、人物の一貫性は保てています。背景も維持していますし、表情だけピンポイントで変更できている点が素晴らしいですね。

2. 目を閉じる

プロンプト

Change only her eyes so that both eyes are gently and naturally closed. Preserve her exact identity, mouth and smile, hairstyle, hair color, outfit, pose, classroom background, composition, anime style, and lighting.
(目元だけを変更し、両目が優しく自然に閉じている状態にしてください。彼女の容貌、口元や笑顔、髪型、髪色、服装、ポーズ、教室の背景、構図、アニメ調のスタイル、そして照明はそのまま維持してください。)

比較結果(元画像と変換後)

変換後画像

考察

こちらも人物の一貫性、背景の維持ができていますね。目も閉じています。まつ毛エクステでもつけたのかくらい綺麗にまつ毛が増えている感じ。

3. 口を閉じる

プロンプト

Change only her mouth so it is naturally closed with relaxed lips. Preserve her exact identity, eyes, facial shape, hairstyle, hair color, outfit, pose, classroom background, composition, anime style, and lighting.
(口元だけを変更し、唇の力を抜いて自然に閉じている状態にしてください。それ以外の要素(本人と分かる特徴、目、顔の輪郭、髪型、髪色、服装、ポーズ、教室の背景、構図、アニメ調のスタイル、照明)はそのまま維持してください。)

比較結果(元画像と変換後)

変換後画像

考察

これもかなり自然に口を閉じられていますね。表情(笑顔)は維持してほしいとプロンプト指示しなかったので真顔になっていますが、指示に忠実。

4. 髪型をロングストレートにする

プロンプト

Change only her hairstyle to long, straight waist-length hair with the same bangs. Keep the original dark hair color. Preserve her exact identity, face, expression, outfit, pose, classroom background, composition, anime style, and lighting.
(彼女の髪型だけを、同じ前髪のまま、腰まで届くストレートのロングヘアに変更してください。元の暗い髪色は維持してください。彼女の容姿、顔立ち、表情、服装、ポーズ、教室の背景、構図、アニメ調のスタイル、そして照明はそのまま変えないでください。)

比較結果(元画像と変換後)

変換後画像

考察

これもかなり自然にロングになっていますね。優秀。細かく見れば髪の毛の色がやや濃くなっている気がしますが、全然許容範囲。ここまで画風を維持して髪型を変更できるとは思いませんでしたねー。

5. 髪色を茶色にする

プロンプト

Change only her hair color to warm chestnut brown, including the bun and loose strands. Preserve the exact hairstyle, identity, face, expression, outfit, pose, classroom background, composition, anime style, and lighting.
(お団子や後れ毛を含め、彼女の髪の色だけを温かみのあるチェスナットブラウンに変更してください。髪型、本人らしさ、顔立ち、表情、服装、ポーズ、教室の背景、構図、アニメ調のスタイル、そして照明はそのまま維持してください。)

比較結果(元画像と変換後)

変換後画像

考察

髪色だけ変更も可能。髪の毛の色以外はちゃんと維持しています。お団子部分もきちんと塗れているので、もう手動で塗り塗りする必要はないですね。

6. 右手を上げる

プロンプト

Raise the girl's right hand, located on the viewer's left, beside her head in a friendly open-palm wave. Preserve her exact identity, face, hairstyle, outfit, left arm, body position, classroom background, composition, anime style, and lighting.
(見る側から見て左側にいる少女の右手を、頭の横で手のひらを開いて親しげに振るポーズにしてください。その際、少女の容姿、顔立ち、髪型、服装、左腕、体の向き、教室の背景、構図、アニメ調のスタイル、そして照明はそのまま維持してください。)

比較結果(元画像と変換後)

変換後画像

考察

今度は動きを指示してみました。右手を挙げて、という指示に対してちゃんとキャラクターの右手を上げています。理解度の低いAIだと、画面から見て右側の手(キャラクターの左手)を上げますが、大丈夫そうです。

ただし手のひらの画風が元絵と違うので、ちょっと違和感が残ります。

7. 背景を公園にする

プロンプト

Replace only the classroom background with a sunny green public park containing trees, grass, a walking path, and soft daylight. Preserve the girl’s exact identity, face, hairstyle, expression, outfit, pose, scale, composition, and anime style.(教室の背景のみを、木々、芝生、散歩道、柔らかい日光のある日当たりの良い緑豊かな公園に置き換えます。少女の正確な身元、顔、髪型、表情、服装、ポーズ、スケール、構図、アニメスタイルを保持してください。)

比較結果(元画像と変換後)

変換後画像

考察

今後は背景チェンジ。背景画像は入力していませんが、それっぽい画像を生成してくれていますね。キャラクターも維持できています。ただ、切り抜き合成感があるのも否めませんが。

8. 人物を横向きにする

プロンプト

Turn the girl and her head 90 degrees so she is shown in a clean right-facing side profile, looking toward the right side of the image. Preserve her identity, hairstyle, outfit, classroom background, anime style, and lighting.(画像の右側を向く綺麗な右向きの横顔になるよう、少女と彼女の頭を90度回転させます。彼女の身元、髪型、服装、教室の背景、アニメスタイル、照明を保持してください。)

比較結果(元画像と変換後)

変換後画像

考察

向きを変えるのもできますね。服装もちゃんと横向きバージョンを作ってくれていますし、向きを変えることで背景の見えなかったところが見えますが、そこもうまく補間してくれています。目が若干元キャラと違うかなーとか思ったりしますが。

9. 人物を後ろ向きにする

プロンプト

Turn the girl and her head 180 degrees so she is shown from directly behind, with the back of her hairstyle and school uniform visible and her face not visible. Preserve her body position, classroom background, composition, anime style, and lighting.(少女と彼女の頭を180度回転させ、真後ろからの姿にし、髪型の後ろ姿と制服が見え、顔が見えない状態にします。彼女の体勢、教室の背景、構図、アニメスタイル、照明を保持してください。)

比較結果(元画像と変換後)

変換後画像

考察

後ろ向きも指示通りできています。制服の後ろ側は元絵には無いわけですが、ちゃんと推測して描いてくれています。服装に関しては違和感ありません。

ただ、立ち位置が上にシフトしてしまっているので、背景と違和感があります。台の上にでも乗っている??ちょっと惜しいですね。ガチャればいいかもしれません。

10. 顔アップにする

プロンプト

Change only the camera framing to a tight centered close-up portrait of her face, from the top of her hair to just below her chin. Preserve her exact identity, expression, hairstyle, hair color, anime style, classroom lighting, and image quality.(カメラのフレーミングのみを、髪の頂点から顎のすぐ下まで、彼女の顔を中心にしたクローズアップポートレートに変更します。彼女の正確な身元、表情、髪型、髪色、アニメスタイル、教室の照明、画質を保持してください。)

比較結果(元画像と変換後)

変換後画像

考察

指示通り顔アップになっています。単に切り抜きしただけではなく、高画質化もされているので、アップスケーラ代わりにも使えるかもしれません。背景は維持という指示にしているので、人だけ前に来た感じにはなっています。

11. 引きの画角にする

プロンプト

Zoom the camera far out to show the girl standing from head to toe in a full-body wide shot in the same classroom. Preserve her exact identity, face, hairstyle, school uniform, anime style, lighting, and natural body proportions.(同じ教室で頭からつま先まで立っている少女を全身引きの引きショットで捉えるように、カメラを大きくズームアウトします。彼女の正確な身元、顔、髪型、制服、アニメスタイル、照明、自然な体型比率を保持してください。)

比較結果(元画像と変換後)

変換後画像

考察

今まで優秀だっただけにここは明らかな失敗。細長くなっちゃいました。解像度が縦長だったのと、背後に大量の机と椅子があったから描けるスペースがなかったのかもしれませんが。

でも、引きのショットにするというだけで、背後にある机と椅子を左右に移動させるというのはびっくり。

12. 花を持たせる

プロンプト

Have the girl hold a small bouquet of fresh red tulips with both hands at chest height. Preserve her exact identity, face, hairstyle, expression, school uniform, body position, classroom background, composition, anime style, and lighting.(少女に、胸の高さで両手で新鮮な赤いチューリップの小さな花束を持たせます。彼女の正確な身元、顔、髪型、表情、制服、体勢、教室の背景、構図、アニメスタイル、照明を保持してください。)

比較結果(元画像と変換後)

変換後画像

考察

指示通り、赤いチューリップを持たせられていますね。表情を変えないでと言ったのに変わっている点と、花と手の画風が元絵と若干違う点はマイナス。それでも優秀な指示追従性能です。

生成速度とメモリ使用量

1枚絵の編集作業で、RTX4070を使った時の結果は以下です。

  • 生成速度平均:144.8秒(約2.4分)

  • VRAM使用量:11,816MB

  • メインメモリ使用量:23,316MB

やはり画像編集モデルはメモリ使用量が多く、メインメモリに溢れてしまいました。その分生成速度が遅くなっています。RTX5090であればもっと高速に編集できるかもしれません。

まとめ

今回はJoyAI Image Edit Plusの1枚画像の編集能力を色々なプロンプトでトライしました。

色々やってみた結果、JoyAI Image Edit Plusはかなり優秀は画像編集AIモデルだと言えます。特に元絵の維持力とプロンプト指示追従性能が素晴らしい!

今回は1枚絵の編集でしたが、JoyAI Image Edit Plusは2枚絵の編集や、枠を指定した編集作業もできるので、次回以降の記事でそれらを取り上げていきます!


最後まで読んでいただき、ありがとうございました!

もし今回の検証が「参考になった」と感じていただけたら、スキを押していただけると今後の励みになります!

今後もローカル画像生成、音声生成、LLMなど、実際に動かして分かったことをまとめていきますので、フォローもぜひよろしくお願いします!

2026/7/26更新:2枚絵編集パターンもトライしました↓


いいなと思ったら応援しよう!

かみもと|ローカルAI生成 若輩者ですが、サポートいただけると、もっとがんばって記事作成します!