−25%

Windows 年払い、10月31日まで。 プランを見る

EQVPS
始める

プライベートな高メモリLLM推論向けVPS

より大きな量子化モデルには、持っていないGPUではなく本物のRAMが要ります。高メモリのCPU箱が30Bクラスのモデルをプライベートに動かす場所、何が現実的で、どこがそうでないか。月$70から。

私たちにはOllamaと小さなモデルのための別ページがあります — それが$12のCPU箱で1B〜8Bと埋め込みを動かすもの。このページは反対側:CPUではなくRAMがあなたを止めるほど大きいモデルです。

まず正直に、どこでも同じ:私たちのサーバーはCPUのみ、GPUなし。 大きなモデルはここで遅く動きます。30Bモデルで速い対話チャットが欲しいなら、GPUホストが要ります — 別の製品、別の提供者。高メモリのCPU箱が得意なのは、チャットウィンドウでない作業のために大きな量子化モデルをプライベートに動かすことです。

RAMの計算

モデルは量子化されていようといまいとメモリに座り、加えてコンテキストとランタイムのオーバーヘッド:

  • 13B、4ビット — おおよそ10〜16 GB。もう中間プランで動きます。
  • 30Bクラス、量子化 — 量子化次第で 24〜48 GB。これが Pro-32からPro-64 の領域。
  • より大きく、または高精度 — 64〜80 GB、80 GBを超えるとうちのどの単一の箱も収まりません。Pro-80 がここの天井です。

だから「より大きなローカルモデルを動かす」は本当に高メモリの問いです。モデルこそがメモリのフットプリント。同じホストにRAGインデックスを足せば数字が積み上がります。

プライバシー優先が本当に勝つ場所

論拠は速度でもコストでもなく — あるデータは外に出られないということです。法務文書。医療記録。専有コード。プロンプトを第三者APIに送ることが論外の何でも。すべてを完全にあなたのマシンで動く遅いモデルが、送るものすべてをログする速いものに勝ちます。私たちはここで全体像を書きました。

そしてデータがそれほど機微なら、支払いもおそらくプライベートであるべきです。箱を暗号通貨とKYCなしで借りることが、鎖全体 — サーバー、モデル、プロンプト、請求 — を誰の身元記録からも遠ざけます。それが売り文句です:より安い推論ではなく、他の誰にも見えない推論。

何を選ぶか

コンテキストの余地を持つ30Bクラスのモデルには、Pro-64(64 GB)が快適な選択;きつい量子化ならPro-32やPro-48に収まり、大きいものはPro-80へ。まずモデルをロードし、常駐メモリを見て、測った値からサイズを取りましょう。そして期待を設定:これはプライベートなバッチ推論で、速いチャットウィンドウではありません。

デプロイの準備はできましたか?暗号通貨で支払い、KYC不要 — 約1分でオンライン。

今すぐデプロイ →

FAQ

これはあなたのOllamaユースケースとどう違いますか?

Ollamaページは$12のCPU箱の小さなモデル — 1B〜8B、埋め込み、軽い作業 — についてです。これは高メモリ側:ロードするだけでも24〜48 GB以上を要する13Bから30Bクラスの量子化モデル。同じCPUのみの現実、はるかに大きいメモリのフットプリント、別のプラン。

あるモデルにRAMはどれくらい?

モデルはメモリに加えてオーバーヘッドとともに収まらねばなりません。13Bの4ビットモデルは〜10〜16 GB;30Bクラスの量子化は24〜48 GBを押す;より大きく高精度にすると64〜80 GBに入り — その先は、うちのどの単一の箱も収まりません。上にコンテキストの余地を加えて。

速いですか?

いいえ — ここで自分に正直に。大きなモデルのCPU推論は毎秒数トークンで、対話的なストリームではありません。バッチと背景の作業には問題なし(夜通し要約、キューを分類)。大きなモデルでのリアルタイムチャットにはGPUが要り、それは提供しません。

APIの代わりにここで動かすのはなぜ?

プライバシー。あなたのプロンプトと出力が提供者のサーバーやログに一切触れません。機微なデータには — 法務、医療、内部コード — すべてを見る速いモデルより、遅いプライベートモデルが勝ちます。KYC不要の暗号決済と組み合わせれば、鎖全体があなたのものにとどまります。

コメント

まだコメントはありません。最初になりましょう。

コメントを残す

コメントは表示される前にモデレートされます。