LLM Runtime Agent は、ZIKUU Mini 上で動作する LLM / AI 推論バックエンドの起動・停止・状態確認を統一的に扱うための小さなホスト常駐サービスを作りました。LLM Brokerの背後で動くサービスです。
LLM Broker は、ホスト側の Runtime Agent にライフサイクル管理を委譲します。
現時点では以下のバックエンドに対応しています。
- llama.cpp
- Lemonade Server

LLM Runtime Agentは systemdで起動しています。

これが、Dockerコンテナとして動くllama.cppサーバーとsystemdのサービスとして動くLemonadeの起動・停止を行います。

状態を見るなら status を呼びます。
# llama.cppサーバーの起動状態を見る
curl -s http://127.0.0.1:8090/backends/llamacpp/status
# lemonadeサーバーの起動状態を見る
curl -s http://127.0.0.1:8090/backends/lemonade/status
起動と停止は、start/stopを呼びます。
# lemonadeサーバーの起動
curl -s -X POST \
http://127.0.0.1:8090/backends/lemonade/start | jq
# lemonadeサーバーの停止
curl -s -X POST \
http://127.0.0.1:8090/backends/lemonade/stop | jq
# llama.cppサーバーの起動
curl -s -X POST \
http://127.0.0.1:8090/backends/llamacpp/start | jq
# llama.cppサーバーの停止
curl -s -X POST \
http://127.0.0.1:8090/backends/llamacpp/stop | jq
これは、最終的に、LLM Brokerが推論機能の負荷分散、キューイング、スケジューリングなどをできるようにするための一歩で、ZIKUU mini専用のサービスではありません。
この投稿は「Ryzen AI NPUの推論能力を検証する」の続きです。
「LLM Runtime Agentの開発」への1件のフィードバック