開発ツールとしてのZIKUU Distilleryが完成

教師モデルが生成した文章を人間が調整し、Seedモデルに学習させ、学習結果を蒸留モデルとして仕立て、Inference Broker経由で配備し、配備したモデルの検証をする。

このループが回るところまで漕ぎ着けました。

これで開発ツールとしてのZIKUU Distilleryは完成です。

これが配備画面です。
学習したモデルを選んで、開発機のInference BrokerとInference Runtime AgentのAPIを使った配備します。

配備が完了すると、推論の検証を行う画面が出ます。

Inference BrokerとInference Runtime Agentにより、VRAM枯渇を避けるために、他の推論資源と排他制御が行われます。

localのBackendsを見ると稼働中の推論資源は text-main と embedding-main。
この状態では、VRAMに通常利用のLLMが載っています。

蒸留モデルにアクセスすると、VRAMに載っているモデルを降ろして、蒸留モデルを載せます。
逆もまた然り。

小さな蒸留モデルとgpt-oss 20bとの速度比較。

まずはgpt-oss 20bが、

プロンプト処理が 603.46 トークン/秒。
生成処理が 105 トークン/秒。

蒸留モデルの方はというと、

プロンプト処理が 4445.91 トークン/秒。
生成処理が 333.22 トークン/秒。

やはり小さなモデルは速い。

小さなモデルが動く小さなコンピューターを並べてLLMオーケストレーションをするとか、小規模な計算資源でAIアプリを動かす、みたいなことをするときには便利だと思います。

ZIKUUの設備では、大きなモデルをSeedにして、巨大な教師モデルを使った蒸留はできませんが、モデルが大きくても小さくても、この仕組みは動くので、掛けられる費用次第でどうにでもなります。

現時点では蒸留モデル開発ツールという位置づけですが、将来的には運用ツールの一つとしてZIKUU Miniに標準インストールされるソフトウェアになるでしょう。

コメントする