余暇のプログラミング – Inference Pipeline PoCアプリ 対話しながら画像生成のやり直す

会話の中で、「画像を作りたそう」を検知して、画像生成をするかを訊いてくるようにしました。

「これ、絵にしたら面白そう。」

に対して、

「画像生成しますか?」

を返してきます。

画像生成を支持すると画像を生成します。

ここで、要望を追加します。

「もっと写真みたいな画像にして。」

さらに、何度かやり取りをしてから、

「ここまでの会話の内容をまとめて画像を生成して。」

(会話の中に「空に鳥を飛ばせたい」などと書いてる)

これは、毎回、画像生成プロンプトを生成しなおしているので、画像に対して、「この部分をこうして」という処理はできていません。

このPoCアプリでは、Inference Brokerの全機能をつついて鍛えるのが目的でもあります。

このアプリの場合、

User: メッセージを送信
↓
AI: メッセージから文脈を抜き出す、必要ならスレッドのタイトルを作る
↓
AI: メッセージを返信
↓
User: 画像が欲しそうなメッセージを送信
↓
AI: 画像生成するか?
↓
User: 画像生成して欲しいと回答
↓
AI: 画像生成 (ここでStable Diffusionバックエンドにリクエストを送って処理)
↓
User: 追加の要求
↓
AI: 画像生成

のような動きをします。


回答メッセージ生成
スレッドタイトル生成
文脈抽出
画像プロンプト生成

をText系バックエンドを呼び出して行い、

画像生成

をStable Diffusion系バックエンドを呼び出す。

現時点では、Text系バックエンドもStable Diffusion系バックエンドも1つですが、複数のバックエンドを用途によって選択するように作るのも簡単。

会話の各ターンの内容をそのままLLMに渡すのではなく、抽出した文脈だけを渡しています。

その文脈束も見られるようにしています。

次は、

  • image-to-image、image-editみたいなバックエンドを追加する
  • 画像生成モデルを増やす
  • 画像の雰囲気を決めるフレーバーを選べるようにする

のような拡張をしようかな。

ZIKUUが目指しているContext Computingのために、文脈抽出だけ高速に処理できるモデルが欲しくなってきます。LLMを蒸留して軽量で高速なモデルを開発したくなってきました。

「余暇のプログラミング – Inference Pipeline PoCアプリ 対話しながら画像生成のやり直す」への1件のフィードバック

コメントする