017:Describeについて
最近はChatGPT、GeminiなどのマルチモーダルなAIモデル(テキストだけでなく、画像や音声等いろいろなフォーマットの入出力に対応したモデル)が登場してきています。
もともとChatGPTなどのLLM系モデルは言語能力が高いので、画像系モデルのSDXL等よりはプロンプト解釈が的確です。なので、狙った服装、狙った構図等、思い通りに画像生成したい場合はマルチモーダルなモデルを使う方が手っ取り早くなってきています。
ただ、マルチモーダルなモデルは今のところクラウド利用しかできないケースが多いので、ローカルでお手軽に出力、というのはもう少し先の話になりそうです。そもそもLLM系モデルは一般的な市販GPUのVRAMには乗り切らないくらいパラメータ数多いですしね…。
そんな時に使えるんじゃないか、というのがこのDescribe機能です。
これは入力した画像からSDXL系のモデルで出力するためのプロンプトを生成してくれるもので、例えばChatGPTで生成した画像に近いものをSDXLから出力させるような使い方ができます。
さっそくやってみましょう。
2枚目の画像がChatGPTに出力してもらった画像です。水墨画で、満月を背景にくノ一がジャンプしている、みたいな指示で出力されました。なかなかいいですね。
さてこれをFooocusでDescribeしてみましょう。3枚目の画像のように、「Imput Image」をチェックして、「Describe」タブを開きます。その画像領域に先ほどの画像をセットして、「Content Type」を「Art/Anime」を選択して「Describe this Image into Prompt」のボタンを押すと、プロンプトが生成されます。プロンプト欄に書かれているのが、Describe結果ですね。
さてこのプロンプトを使って早速出力してみましょう。その結果が4枚目です。
なかなかイイ感じなんじゃないでしょうか。
さて、今度はくノ一姉さんをいつものMuaccaさんに差し替えてみましょう。人物フレーズを差し替えて、モノクロではなくカラーで出力するようにプロンプトを変更した結果が5枚目です。
かっこいいですね。
ちなみに今回、Describeする際に「Apply Styles」をチェックしていたので、styleとして「Fooocus V2」と「Fooocus Masterpiece」が適用されていました。これをいつもの絵柄にするために自分のstyleに変更したのが6枚目です。
この状態で、Fooocusの「Image Prompt」(指定した画像も参考にして出力してくれる機能、7枚目画像のようにして指定)も併用して出力したのが1枚目の画像でした。元画像の雰囲気に少し寄る気がしますね。
ちなみに他のi2iも試してみました。
「Vary(Subtle)」で出力したのが8枚目、「Vary(Strong)」で出力したのが9枚目です。
色々な手段があるのは嬉しいですね。
今回のプロンプトは以下の通りです。ご参考まで。
=========================
1girl, _, from _, solo, pale pink blonde hair, very short hair, long sidelocks, hair between eyes, red eyes, round glasses, pointy ears, large breast, looking at viewer, gloves, full body, weapon, japanese clothes, sword, mask, moon, sheath, full moon, mouth mask, covered mouth, ninja, weapon on back, short sword, ninja mask, BREAK masterpiece, best quality, high score, great score, ultra-detailed high resolution (anime-style 3dcg:1.0), intricate details light color, whitish color line art, light diffusion, muted color, Matte flat color, watercolor gradiation, hyper-realistic, Sleek design
6
036:Qwen Image Edit の使い方
全体公開
今回は、元画像からテキスト指示で画像を編集できるQwen Image Editを試してみました。 例によって、差分の画像をStart-Endにフレーム指定して動画を作るのに便利、という動機からです。 まずは元画像としていつものようにAnim4gineで画像を用意します(2枚目)。 これを3枚目の画像のようにしてQwen Image Editのワークフローにセットします。 プロンプトとしては、「背景だけをフォトリアルな森の画像に差し替えてください」みたいな自然文をgoogle翻訳で英語にしたものを使ってみました(4枚目)。 今度は4枚目の画像を元にして、「キャラクターを削除して背景だけにしてください」とすると、5枚目のような森の風景だけの画像になりました。消しゴムマジックみたいなことができますね。 さらに「キャラクターを削除するけど、線画だけは残してくれ」としてみたのが6枚目で、そこから「背景を夜にして、線画を光らせてくれ」としたのが1枚目、といった感じです。 nano bananaほど指示がきれいに反映されるというわけではなく、融通が利かないところもあるんですが、これをローカルのPCで使い放題というのは結構楽しいです。 いろいろ試してみたくなりますね。
6
035:Anytestの使い方
全体公開
Wan2.2で動画を作るときにはポーズ差分の画像があるとStart-Endでフレーム指定で安定した動画が生成できるので、最近はポーズ差分画像をどう作るかをいろいろ試しています。 nano bananaは強力なのですが、制約があったり絵柄がnano banana絵柄に寄ったりするので他の手段も試している、というか。 私がメインで使っている画像生成モデルはAnimagine4なので、Controlnetでポーズ指定するという手が使えます。 SDXL系のControlnetとしてはAnytestという強力なブツがあるので、それを試してみました。 まずは2枚目のような、大雑把な構図指定画像を手描きします。これはClip Studio Paintでマウスでちょいちょいと5分程度で描いた代物で、「まあなんとなく言いたいことは分かる」レベルのものかな、と思います。 この構図指定画像を参照画像として設定しているのが3枚目の画像で、Anytestを使うためのComfyUIワークフローです。このワークフローで画像を生成したのが1枚目です。なんとなくそれっぽくはなっている気がしますね。 ↓プロンプトはこんな感じにしています。 1girl, _, from _, blonde long hair, blue eyes tareme, forehead, pointy ears large breast, groin tendon slim bod, single-shoulder long magical black robe, bra strap, mini skirt under robe frill skirt, contrapposto, water wave background, smile, (glitter magic circle effect:1.2) from hand, blue water effect, pure clear realistic water, splash water around wind blowing さて、Anytestですが、結構いろいろなことができる「万能Controlnet」と言われていて、例えば4枚目の画像の真ん中の部分を黒塗りでつぶして(5枚目)これを参照画像として渡すと、1枚目の画像のポーズを変更することができたりもします(6枚目)。 1枚目の画像と6枚目の画像を動画のStart-Endフレームに指定すれば、なんとなく水魔法を使っているエルフ姉さんの動画ができるような気がしますね! とまあこんな感じに便利なControlnet「Anytest」ですが、月須和さんがHuggingFaceで公開してくれています。ありがたいですね。 https://huggingface.co/2vXpSwA7
3
034:InfiniteTalkで読み上げ動画を作る
全体公開
前回はWan2.2のS2Vモデルを使って、セリフ音声と画像から、読み上げ動画を作りましたが、今回はセリフ音声と動画から、読み上げ動画を作ってみます。 前回のはWan2.2 S2Vで1枚の画像から動画を生成したのですが、口元以外の箇所はあまり動かないというか、ほぼ口パク動画、みたいな感じでした。 今回は人物がなにか動いている動画をもとに、口元をセリフに合わせて口パクさせるというもので、動きのある読み上げ動画を作る場合はこちらの方が良いようです。 こういった手法はVideo to Video(V2V)と呼ばれているようですね。 読み上げのためのV2VにはInfiniteTalkを用いてみました。 InfiniteTalkはまだWan2.2には対応していないので、Wan2.1と組み合わせて使ってみています。 2枚目の画像がInfiniteTalkを使うためのComfyUIのワークフローで、画面下の方で元となる動画(1枚目)を指定しています。 セリフ音声は上の方(音声を読み込む、のところ)に指定してみています。 3枚目もワークフローの一部で、真ん中のあたりにプロンプトを指定しています。この手法の場合、キャラクターの見た目も動きも動画で指定しているので、プロンプトは簡単に「The woman turns to me, stretches her body, and speaks with a smile.」(その女性は私の方を向き、体を伸ばして、笑顔で話します)としました。 あとは実行すると、セリフ音声に合わせて口元の動きが調整されます。
3
033:Wan22 S2Vで読み上げ動画を作る
全体公開
今回はWan2.2のS2Vモデルを使って、セリフ音声と画像から、読み上げ動画を作ってみました。 S2Vは、音声からそれに合った動画を生成するものですが、元画像を指定するとそれをもとにI2Vのように画像に沿った動画を生成してくれます。 前回使った魔法少女画像の顔アップ(2枚目)を元画像に指定し、音声として「魔法少女Muacca、いつもみんなと楽しく、ですです」という読み上げ音声を指定してできたのが1枚目の動画です。 残念ながらちちぷいには音声付の動画は投稿できないので、口パクだけになってしまいますが、元画像のキャラがなにかしゃべっている感じになっているのは分かるかと思います。 Wan2.2 S2Vですが、UIとしては公式から配布されているComfyUIワークフローを用いて実行しました(3枚目)。 基本的にはデフォルト値のままで使うのがいいようです。 ちなみに16fpsが指定されているのですが、これを30fpsとかにすると音声と口パクがズレるので、変えないほうが良いようです。fpsを変更したい場合は、生成した動画を別のツールでフレーム補間すればよいと思います。 あと、公式の情報では生成される動画は77フレーム分と書いてあって、これは変更しないほうが良いとのことでした。16fpsだと4秒くらいの動画になるはずなのですが、結果として生成されたのは14秒くらいのものだったので、それがなぜなのかはよくわかりません。投入した音声は4秒くらいだったので、ここに投稿しているものは後ろの無音声部分をカットしてあります。
他のクリエイターの投稿
40
40枚:DQコスプレイヤー
150コイン/月以上支援すると見ることができます
2
近衛機カイザーシュッツ
100コイン/月以上支援すると見ることができます
24
蒼森ミネ
500コイン/月以上支援すると見ることができます
26
【センチ~if~】沢渡ほのか:高校生時代①~入学式~
100コイン/月以上支援すると見ることができます
20
花游幻媛 陸
500コイン/月以上支援すると見ることができます
13
花咲く浮遊島でひとやすみ
580コイン/月以上支援すると見ることができます
2
泉の妖精(フォレスト)とバニラアイスを食べる妖精(タウン)
150コイン/月以上支援すると見ることができます
14
飛行艇で進む空の旅
580コイン/月以上支援すると見ることができます
【曲】あっち #52|[Song] That Way #52
全体公開
下記楽曲のアートワークとして制作しました。 Created as artwork for the music video below. ⇜←↗↕⇜ https://youtu.be/ulv9hP5HFs4 (Model) Midjourney V8.1 (Size) 5888 x 3296 pixels (Upscaler) unlimited waifu2x *2x / Model: swin_unet - photo / DeNoise: Medium / Tile: 640, Shuffle / TTA: 0 / Alpha Channel: Disable (Last Seed) 2256047363 (i2i Count) 0 time (Manual Adjustment) Handwritten, Sharpness Prompt: abstract, many long arrow symbols, summer fluorescent light, vibrant, pop, complex collage, realistic smooth marbling, ripples on graph paper, distortion, melting, dotted, ground and underwater, submerged, many randomize arrow symbols and transparency moths, tactiles, closed wings, spiral patterns, look away, a diverse array of glitch effects made from giant tiles, clear white, colorful, beautiful and ephemeral, high contrast, niche character design, kawaii chibi moth girl, all hair made moths, wavy eyes, flat illustration, intense marbling, complex patterned zentangle background, portrait, dynamic angle from oblique side, bright colors, wearing kente patterned dress, moth scales fluttering in the air, child's body proportions, nostalgic --v 8.1 --sref 1958468279::3 1256473810::1 2303749492::1 2770257201::1 779819511::1 2361630497::2 2690515967::1 970460098::2 657749254::1 1811613415::1 --sw 150 --sv 6 --s 200 --ar 16:9 --hd --seed 2256047363
2
眼鏡取ると可愛い地味子さん
100コイン/月以上支援すると見ることができます
7
騎士と村娘162~168
100コイン/月以上支援すると見ることができます
8
二人のJK390~396
100コイン/月以上支援すると見ることができます
7
草原少女162~168
100コイン/月以上支援すると見ることができます
「ちちぷいマーケット」をリリースしました!
全体公開
みなさん、こんにちは!🌟 このたび、「ちちぷいマーケット」をリリースしました!🎉 ちちぷいマーケットは、AIイラストやAIマンガなどのデジタルコンテンツを売買できる新しい機能です。 お気に入りの作品を購入したり、クリエイターとして自分の作品を販売したりと、これまで以上にAI作品を楽しめる場としてご利用いただけます。 🛍 マーケットでできること ■商品を購入 気になる商品をコインで購入できます。 購入した商品は購入履歴からいつでも再ダウンロードできるため、端末を変更した場合や再度ダウンロードしたい場合も安心です。 🎉 リリース記念! 公式アカウントでは、これまで投稿企画などで公開したイラストに加え、新規イラストも収録した「【リリース記念】ちちぷいちゃんイラスト集」を販売しています! マーケットを体験しながら、ぜひお手に取ってみてください。 https://market.chichi-pui.com/products/425e9535-da62-4257-ad26-593eaa59d2a0/ ■商品を販売 条件を満たしたユーザーは、販売者登録を行うことで自分だけのマーケットを開設できます。 商品登録や販売状況、売上の確認なども、ダッシュボードからまとめて管理できるようになっています。 🚀 販売機能について 販売機能は、現在一部のユーザーを対象に順次公開しています。 準備が整い次第、対象ユーザーを順次拡大していく予定ですので、開始まで今しばらくお待ちください。 🔮 今後のアップデート予定 今回のリリースは、ちちぷいマーケットの第一歩です。 今後は、商品をさらに探しやすくする機能や、おすすめ商品の表示、検索機能やランキング機能など、より快適にお買い物を楽しめるようアップデートを予定しています。 皆さまからいただくご意見・ご要望も参考にしながら、より便利で使いやすいマーケットへ育ててまいります。 ぜひ、新しく始まったちちぷいマーケットをお楽しみください! 今後もみなさんにとって「使いやすく!」「楽しく!」利用できるサイトを目指して、継続的に改善を進めてまいります。✨
3
絵柄指定プロンプト【第五弾】
100コイン/月以上支援すると見ることができます
6
船上デート
100コイン/月以上支援すると見ることができます