LLM Runtime Agentの開発

LLM Runtime Agent は、ZIKUU Mini 上で動作する LLM / AI 推論バックエンドの起動・停止・状態確認を統一的に扱うための小さなホスト常駐サービスを作りました。LLM Brokerの背後で動くサービスです。

LLM Broker は、ホスト側の Runtime Agent にライフサイクル管理を委譲します。

現時点では以下のバックエンドに対応しています。

  • llama.cpp
  • Lemonade Server

LLM Runtime Agentは systemdで起動しています。

これが、Dockerコンテナとして動くllama.cppサーバーとsystemdのサービスとして動くLemonadeの起動・停止を行います。

状態を見るなら status を呼びます。

# llama.cppサーバーの起動状態を見る
curl -s http://127.0.0.1:8090/backends/llamacpp/status

# lemonadeサーバーの起動状態を見る
curl -s http://127.0.0.1:8090/backends/lemonade/status

起動と停止は、start/stopを呼びます。

# lemonadeサーバーの起動
curl -s -X POST \
  http://127.0.0.1:8090/backends/lemonade/start | jq

# lemonadeサーバーの停止
curl -s -X POST \
  http://127.0.0.1:8090/backends/lemonade/stop | jq

# llama.cppサーバーの起動
curl -s -X POST \
  http://127.0.0.1:8090/backends/llamacpp/start | jq

# llama.cppサーバーの停止
curl -s -X POST \
  http://127.0.0.1:8090/backends/llamacpp/stop | jq

これは、最終的に、LLM Brokerが推論機能の負荷分散、キューイング、スケジューリングなどをできるようにするための一歩で、ZIKUU mini専用のサービスではありません。

この投稿は「Ryzen AI NPUの推論能力を検証する」の続きです。

「LLM Runtime Agentの開発」への1件のフィードバック

コメントする