まず正直に:速く、安く、高品質な生成が欲しいなら、APIを呼びましょう。CPU VPSはGPUで一杯のデータセンターに勝てず、そうでないと言う者は何かを売っています。
ではなぜ推論を自ホストするのか?理由は一つ、そしてそれは良いもの:あなたのサーバー上のモデルは、あなたのプロンプトをどこにも送りません。
CPU推論は実際どう見えるか
十分なRAMがあればCPUで本物のモデルを動かせます。4ビットに量子化された7〜8Bモデルは動く。13Bも動く。メモリがあれば30Bクラスも押せます。できないのはそれを速くすること — 出力は毎秒数トークンで来て、APIが与える即時のストリームではありません。
それが正直な取引です。対話的チャットには苛立たしい。背景作業には — 夜通し文書を要約する、キューを分類する、スケジュールでデータを豊かにする — 毎秒数トークンで完全に問題なく、誰も時計を見ていません。
RAMの計算
モデルは量子化されていようといまいとメモリに座らねばならず、加えてコンテキストとランタイムのオーバーヘッド:
- 7〜8B、4ビット — 約6〜8 GB。中間プランで動く。
- 13B、4ビット — おおよそ10〜16 GB。
- 30Bクラス、量子化 — 量子化次第で24〜48 GB。
- より大きい、または高精度 — 速く64〜80 GBに入り — 80 GBを超えると単一のPro箱では収まらず、なおCPUで遅い。
だから「ローカルモデルを動かす」は静かに高メモリの問いになります。モデルこそがメモリのフットプリントです。同じ箱にRAGインデックスやエージェントを足せば、数字が積み上がります。
OllamaとvLLM、手短に
Ollamaは簡単な入口 — インストールし、ollama run、以上。ただモデルが使えればいいプライベートな単一ユーザー構成には正しい道具です。vLLMはサービングのスループットのため:より多くの設定、同時負荷下で優秀、実際に量をさばくとき値打ちがあります。Ollamaから始め;本物のトラフィックをさばくときvLLMへ手を伸ばしましょう。
プライバシー優先が本当に勝つ場所
自ホスト推論の論拠は速度やコストではなく — あるデータは外に出られないということです。法務文書。医療記録。専有コード。プロンプトを第三者APIに送ることがポリシーや信頼の理由でありえない何でも。すべてを完全にあなたのマシンで動く遅いモデルが、送るものすべてをログする速いものに勝ちます。
そしてデータがそれほど機微なら、支払いもおそらくプライベートであるべきです。箱を暗号通貨とKYCなしで借りることが、鎖全体 — サーバー、モデル、プロンプト、請求 — を誰の身元記録からも遠ざけます。それが実際の売り文句です:「より安い推論」ではなく、「他の誰にも見えない推論」。
結論
速度と品質には、APIを使う — 恥はありません。プライバシーが要件で遅いのが受け入れられるとき自ホスト。モデルとそのコンテキストと箱を共有する他のもののためにサイズを取り、CPUからGPU速度を期待しないこと。
モデルが本物のメモリを要するとき、Proラインは専用IPと夜間バックアップで32から80 GBを動かします — 本格的な量子化モデルを、周りにコンテキストの余地を持って保持するのに十分です。
コメント
まだコメントはありません。最初になりましょう。