LLM Broker/Vision BrokerからInference Brokerへの移行

テキスト系の推論資源サーバー LLM Broker と画像系の推論資源サーバー Vision Broker に別れていた責務を、Inference Broker に統合して、推論資源サーバーにできたので、既存のアプリケーションをすべて Inference Broker を使用するように修正しました。

ApplicationカテゴリーのソフトウェアはZIKUU Miniには入りませんが、何らかの形で同等の機能を入れようと思っています。

ざっくり説明すると、

  • Inference Broker は Inference Runtime Agent を使って、バックエンドの推論資源の起動・停止を行います
  • VRAMが足りなくなる場合は、VRAMを専有しているバックエンドを自動的に停止して、目的のバックエンドを起動します
  • OpenAI API互換です
  • バックエンドには、llama.cpp、Lemonade、SD NPU Backend (ZIKUU製)、GPU Inference (ZIKUU製)があり、複数サーバーにまたがって推論資源を管理、推論リクエストの送信が行えます

ZIKUU Miniは NPU搭載機なので、画像生成、画像解析、文字起こしについて、NPUを使うバックエンドとリモートホストのGPUを使うバックエンドに接続されています。

ZIKUUのフルシステムの場合は、NPU搭載機を使っていないので、LemonadeとSD NPU Backendのパスがありません。

いずれにしても、Inference Broker のAPIだけで、すべての推論処理が行えるようになっていて、バックエンドは抽象化された名前でアクセスできるので、実体が何であるかを知る必要がありません。

「LLM Broker/Vision BrokerからInference Brokerへの移行」への1件のフィードバック

コメントする