ZIKUUでは自作PCワークショップなるものをやっている。
必要なのはPCの部品代だけ。
モノづくりを主体とするCADやグラフィックスを扱える構成、プログラミングやITを学ぶ構成といった具合に、用途に応じた構成案は一応作ってある。
ZIKUUのフルシステムを開発する程度ならば、16GB VRAM搭載のGPUがあれば十分なので、仮にAIプログラミングをやるのが前提だとしても、それほど大きな出費にはならない
筈だった。
過去には、AI学習をするためのPC構成をこのブログにも書いたが、自分でPCを組むことには依然として価値があるとは思っているものの、最近のメモリやSSDの高騰を考えると、軽々と「PC組めば」とは言えなくなってきた。
もともとは「AIを使うには、それなりのGPUを積んだPCが必要」という発想だったが、今ではInference Brokerを作り、Tailscaleメッシュを組んだので、ファインチューニングや言語モデル開発というようなLLM自体を作る作業以外は、塾のGPUをコミュニティーのみんなが使えるようになった。
つまり、計算資源そのものを利用者の手元から切り離した。
1年前は、
学ぶ人自身が計算資源を購入する
という設計だった。
それが今では、
安価なPC + ネットワーク参加権 = AI開発環境
に近づいている。
共同体が計算資源と知識基盤を持ち、学ぶ人はそこへ接続する
という設計になっている。
しかも計算資源だけじゃない。
Repository ExplorerやCPS、Pivotみたいなものまで共有されると、積み上がっていくのはGPU性能ではなく、
計算資源 + ソフトウェア + 知識 + 文脈 + 運用経験
になる。
これで、
高価な計算資源を所有できる人だけが高度なAIを学べる
という構造から離れられた。
これは、
鉄道を通せば、移動も運搬も便利になって、沿線が栄える
と同じことだ。
個人が強力な運搬能力を所有しなくても、駅にアクセスできれば巨大な運搬能力を利用できる。そして鉄道ができることで、人や物が動くだけではなく、沿線に商店や工場や住宅が生まれ、それまで成立しなかった活動まで成立する。
今のZIKUUの構造も、
Tailscale → 線路
Inference Broker → 運行・配車系
GPUノード → 機関車
Open WebUI / Continue / Codex → 利用する列車
Repository Explorer → 専門的な輸送サービス
くらいに見立てられる。
そしてCPS、Pivotなどまで含めると、単なるAI利用網ではなく、知識を蓄積して運ぶ別の物流網まで重なってくる。
面白いのは、インフラができると、その上で何が生まれるかを最初から全部予測する必要がないことだ。
鉄道会社が「この駅前には将来この店ができ、この工場が建つ」と全部設計したわけではない。まず移動コストを劇的に下げる。その結果、それまで採算が合わなかった活動が勝手に成立し始める。
しかも今の構造なら、共同体の予算しだいで、普通の列車が新幹線やリニアモーター列車になる。
最初から全員に新幹線を買わせる必要がない。まず在来線を通しておけばいい。
現時点では、安価なGPUでも、多少遅いローカルLLMでも、線路そのものは機能する。そして予算ができたら、GPUノードを強化する、より大きなモデルを載せる、推論専用機を追加する。
すると利用者は、Open WebUIやContinueやCodexの使い方を変えなくても、
昨日まで普通列車だったものが、ある日新幹線になる。
さらにInference Brokerの複数ノード化、負荷分散、キューイング、フォールバックまで進めば、「速い機関車を一台買った」というより、複線化したり、ダイヤを組んだり、貨物線と旅客線を分けたりする段階に入る。
だから今やっていることは、
「高性能AIを買う」ではなく、「高性能AIが来たときに、その能力を共同体全体へ配れる基盤を作っている」
とも言える。
現在のZIKUUシステムでは、PCIe 4.0 x 8のRTX 2000 Adaと、PCIe 4.0 x 16のRTX A4000で、ほとんど差がない。これは制約条件を設計に取り込んだから。
PCIeだけ見ると、
- RTX 2000 Ada:PCIe 4.0 x8
- RTX A4000:PCIe 4.0 x16
なので、スペック表ではA4000側がかなり立派に見える。でも、ZIKUUでやっているようなモデルをVRAMに載せて、そこから推論を回し続ける処理では、PCIeの線路を常時大量に往復するわけではない。
ボトルネックは主にGPU内部の計算とVRAM側にあるので、モデルが収まっている限り、x8とx16の差がほとんど表に出ないのは自然だ。
AI用途では、ゲーミングPC的な
PCIe x16!
最新CPU!
ハイエンドマザー!
巨大なGPU
というスペック競争から、かなり自由になれる。
CPUもPCIeもそこそこでいいから、必要量のVRAMを持ったGPUを安定して動かせる箱でいい。
しかもInference Brokerの後ろへ置いてしまえば、その箱がどんなマザーボードで、CPUが何で、GPUがx8接続なのかなんて利用者には関係ない。70 tok/s出るノードなら70 tok/sの推論資源として使えばいい。
これ、今後のZIKUUの設備投資にも結構効いてくる。
高価な「AIワークステーション」を買う必要はなくて、価格あたりのVRAM容量・推論性能・電力効率が良い計算ノードを足していけばいい。
余裕のある人は、すごいワークステーション、すごいGPUを買えばいい。
高性能であることは、この手のことをやるには魅力だ。
しかし、誰もがそれをできるわけではない。
そんな人から選択肢を奪って良いのか。
良くない。
計算資源の供給力を増やしても月謝が値上がりするわけではない。
供給力を増やせば、恩恵を得られる人が増えるだけだ。
出来ないことを想像して諦めるのではなく、出来ることを工夫しながら挑戦していく。
無いものを嘆くのではなく、有るものを有効に使う。
そういう姿勢が大事なのだ。
私の開発環境
実は、私の開発環境は、けっこうしょぼい。
自宅の作業用PCは、2018年製のノートPCと2016年製のミニPCで、どちらもUbuntu Desktop 24.04を入れている。
今なら、中古で3万円から4万円で買える。
これなら中高生でも手が出せるだろう。
VPNを経由して、ThinLincを使って塾のNVIDIA RTX A4000搭載の2024年製PCを動かすので、手元のPCが非力でも問題ない。CADを使うときは、別にXeon W-1250P+GPU搭載のワークステーションがある。これもThinLincで接続して使う。これらはWake on LANで起動できるようにしている。
また、AI処理をしたいときは、塾のGPUサーバーにInference Broker経由でつなぐから、しょぼい手元のPCでAI ChatもCodexも使える。手元のPCに高価なGPUを載せなくてもいい。
いずれ、高速でコア数の多いThinLincサーバーと、複数の小さなGPUサーバーを置いて、みんなが安価なPCから計算資源を思い切り活用できるようにしたいと思っている。
ZIKUUのInference Brokerは推論資源を統合管理するサーバーだが、バックエンドは多様だ。
ランタイムを列挙すると、
- llama.cpp
- Ollama
- Lemonade
などの他に、ZIKUUで開発した
- SD NPU Backend サーバー ・・・Ryzen AIシリーズのNPUを使うStable Diffusion用のランタイム
- GPU Inference サーバー・・・Whisper/Vision/Stable Diffusionを動かすランタイム
がある。
アプリケーションから見ると、これらのランタイムにバックエンドの名前でアクセスできるので、ランタイムの実体が変更されても、アプリケーションの修正は不要だ。
現時点では、各ランタイムをWeb UIから手動でOn/Offする仕様だが、いずれ、それを自動化し、推論処理のスケジューリングやキューイングができるようにする予定だ。これにより、常駐する必要のないモデルを必要に応じてVRAMに載せる/降ろすが自動化される。
「塾生にAI学習用PCの購入をすすめないという話」への1件のフィードバック