ここまで、Inference Brokerが対応していた推論資源は、
- llama.cpp Vulcanバックエンド
- AMD Stable Diffusion
- Lemonadeを使ったWhisper
- NPUを使ったStable Diffusion
- Lemonadeを使ったStable Diffusion
- Lemonadeを使ったVisionモデル
- llama.cpp Cuda バックエンド
でしたが、新たに、
- Cuda版Visionモデル(Vision Brokerの担当だった)
- Cuda版Stable Diffusion(Vision Brokerの担当だった)
- Cuda版Whisper(新)
にも対応します。
この対応が終わると、Inference BrokerがNVIDIA GPU/Ryzen AI CPU/NPUを使った推論資源を一手に引き受けることができ、LLM BrokerとVision Brokerの機能を完全に吸収できます。
今日の開発では
- GPU Inferenceという、Vision/StableDiffusion/WhisperをGPU上で利用するサーバーの開発
- Inference Runtime Agentの拡張
をやりました。
これがZIKUUの推論層の完成形です。
Inference Broker
→ Inference Runtime Agent (デーモン)
→ GPU Inference (VL/Stable Diffusion/Whisper)
→ SD NPU Backend (デーモン/NPU版Stable Diffusion)
→ Lemonade
→ llama.cpp
→ Ollama
という構成です。

そしてVisionモデルのテスト結果。
NPU版

GPU版

「Inference Broker – GPUを使ったVision系モデルへの対応」への1件のフィードバック