私たちにはOllamaと小さなモデルのための別ページがあります — それが$12のCPU箱で1B〜8Bと埋め込みを動かすもの。このページは反対側:CPUではなくRAMがあなたを止めるほど大きいモデルです。
まず正直に、どこでも同じ:私たちのサーバーはCPUのみ、GPUなし。 大きなモデルはここで遅く動きます。30Bモデルで速い対話チャットが欲しいなら、GPUホストが要ります — 別の製品、別の提供者。高メモリのCPU箱が得意なのは、チャットウィンドウでない作業のために大きな量子化モデルをプライベートに動かすことです。
RAMの計算
モデルは量子化されていようといまいとメモリに座り、加えてコンテキストとランタイムのオーバーヘッド:
- 13B、4ビット — おおよそ10〜16 GB。もう中間プランで動きます。
- 30Bクラス、量子化 — 量子化次第で 24〜48 GB。これが Pro-32からPro-64 の領域。
- より大きく、または高精度 — 64〜80 GB、80 GBを超えるとうちのどの単一の箱も収まりません。Pro-80 がここの天井です。
だから「より大きなローカルモデルを動かす」は本当に高メモリの問いです。モデルこそがメモリのフットプリント。同じホストにRAGインデックスを足せば数字が積み上がります。
プライバシー優先が本当に勝つ場所
論拠は速度でもコストでもなく — あるデータは外に出られないということです。法務文書。医療記録。専有コード。プロンプトを第三者APIに送ることが論外の何でも。すべてを完全にあなたのマシンで動く遅いモデルが、送るものすべてをログする速いものに勝ちます。私たちはここで全体像を書きました。
そしてデータがそれほど機微なら、支払いもおそらくプライベートであるべきです。箱を暗号通貨とKYCなしで借りることが、鎖全体 — サーバー、モデル、プロンプト、請求 — を誰の身元記録からも遠ざけます。それが売り文句です:より安い推論ではなく、他の誰にも見えない推論。
何を選ぶか
コンテキストの余地を持つ30Bクラスのモデルには、Pro-64(64 GB)が快適な選択;きつい量子化ならPro-32やPro-48に収まり、大きいものはPro-80へ。まずモデルをロードし、常駐メモリを見て、測った値からサイズを取りましょう。そして期待を設定:これはプライベートなバッチ推論で、速いチャットウィンドウではありません。
コメント
まだコメントはありません。最初になりましょう。