テキスト系の推論資源サーバー LLM Broker と画像系の推論資源サーバー Vision Broker に別れていた責務を、Inference Broker に統合して、推論資源サーバーにできたので、既存のアプリケーションをすべて Inference Broker を使用するように修正しました。
ApplicationカテゴリーのソフトウェアはZIKUU Miniには入りませんが、何らかの形で同等の機能を入れようと思っています。
ざっくり説明すると、
- Inference Broker は Inference Runtime Agent を使って、バックエンドの推論資源の起動・停止を行います
- VRAMが足りなくなる場合は、VRAMを専有しているバックエンドを自動的に停止して、目的のバックエンドを起動します
- OpenAI API互換です
- バックエンドには、llama.cpp、Lemonade、SD NPU Backend (ZIKUU製)、GPU Inference (ZIKUU製)があり、複数サーバーにまたがって推論資源を管理、推論リクエストの送信が行えます

ZIKUU Miniは NPU搭載機なので、画像生成、画像解析、文字起こしについて、NPUを使うバックエンドとリモートホストのGPUを使うバックエンドに接続されています。
ZIKUUのフルシステムの場合は、NPU搭載機を使っていないので、LemonadeとSD NPU Backendのパスがありません。
いずれにしても、Inference Broker のAPIだけで、すべての推論処理が行えるようになっていて、バックエンドは抽象化された名前でアクセスできるので、実体が何であるかを知る必要がありません。
「LLM Broker/Vision BrokerからInference Brokerへの移行」への1件のフィードバック