Inference Broker – GPUを使ったVision系モデルへの対応

ここまで、Inference Brokerが対応していた推論資源は、

  • llama.cpp Vulcanバックエンド
  • AMD Stable Diffusion
  • Lemonadeを使ったWhisper
  • NPUを使ったStable Diffusion
  • Lemonadeを使ったStable Diffusion
  • Lemonadeを使ったVisionモデル
  • llama.cpp Cuda バックエンド

でしたが、新たに、

  • Cuda版Visionモデル(Vision Brokerの担当だった)
  • Cuda版Stable Diffusion(Vision Brokerの担当だった)
  • Cuda版Whisper(新)

にも対応します。

この対応が終わると、Inference BrokerがNVIDIA GPU/Ryzen AI CPU/NPUを使った推論資源を一手に引き受けることができ、LLM BrokerVision Brokerの機能を完全に吸収できます。

今日の開発では

  • GPU Inferenceという、Vision/StableDiffusion/WhisperをGPU上で利用するサーバーの開発
  • Inference Runtime Agentの拡張

をやりました。

これがZIKUUの推論層の完成形です。

Inference Broker
→ Inference Runtime Agent (デーモン)
→ GPU Inference (VL/Stable Diffusion/Whisper)
→ SD NPU Backend (デーモン/NPU版Stable Diffusion)
→ Lemonade
→ llama.cpp
→ Ollama

という構成です。

そしてVisionモデルのテスト結果。

NPU版

GPU版

「Inference Broker – GPUを使ったVision系モデルへの対応」への1件のフィードバック

コメントする