−25%

Windows 年払い、10月31日まで。 プランを見る

EQVPS
始める

OllamaでVPSにローカルLLMを自ホストする — 実際に効くもの

2026年6月14日 · 1 分で読める · EQVPS Team

すべてのプロンプトを誰かのAPIに送るのは問題ありません — そうでなくなるまでは。データが機微でサーバーを決して出したくないかも。レート制限に、あるいはモデルバージョンが足元で変わることに、実験中にトークンごとの計量が刻むことに疲れたかも。ある時点で「自分のを動かしたら?」が思考実験でなくなります。

Ollama がそれを本当に簡単にします。より難しい問いは VPSに何が収まるか — そしてここでは正直な答えが誇張より大事です。

CPUで実際に何を動かせるか

GPUなし?ならCPU推論をしていて、モデルサイズがすべてです。量子化(重みを4ビットに絞る)がこれを実用的にします — 品質のかけらを失い、メモリの山を節約します。

おおよその数字、大事なもの:

  • 3Bモデル、4ビット — ~3 GB RAM。チャットや簡単なタスクに十分軽快。
  • 7Bモデル、4ビット — ~5 GB RAM。スイートスポット:目に見えて賢く、なお読める速さで動く。
  • 13B以上 — 8-10 GB以上でCPUでは遅い。技術的には可能、実用的には煩わしい。

速さ、正直に:数vCPUで毎秒数トークンを見ます。読みながら打たれるチャットボットやコーディングアシスタントには完璧に問題なし。100万文書のバッチ処理には向かない — それはGPUの仕事で、私たちは装いません。GPUインスタンスは提供しません。 プランに70Bモデルや重いスループットが要るなら、CPU VPS — うちのも誰のも — は間違った道具で、一銭使う前にそれを知るべきです。

でもあなたの質問に答え決して家に電話しないプライベートな7B?それは6 GBの箱で快適に動きます。

インストール — 三つのコマンド

サーバーを立ち上げ、SSHで入り、そして:

curl -fsSL https://ollama.com/install.sh | sh   # Ollamaをインストール
ollama run llama3.2:3b                            # 3Bモデルをプル+実行

それだけ — ターミナルでチャットしています。自分のコードから使うには、Ollamaがすでにポート11434でHTTP APIを提供します:

curl http://localhost:11434/api/generate -d '{
  "model": "llama3.2:3b",
  "prompt": "Summarize this changelog in two lines: ...",
  "stream": false
}'

先に知っておく価値がある落とし穴一つ:既定でそのAPIはlocalhostにバインドします。そのままにしてSSHでトンネルするか、さもないとインターネットに晒されます。到達可能にしたいなら認証の後ろに置きましょう — 公開IPに開いたモデルエンドポイントを残さないこと。

箱を選ぶ

プランをモデルに合わせる、逆ではなく:

動かしたいもの必要なRAM妥当なプラン
3Bモデル、軽い利用~3 GBSmall(4 GB)
7Bモデル、快適に~5-6 GBMedium(6 GB)
より大きい / 高スループットGPU領域CPU VPSではない

ほとんどの自ホスト勢には、Medium(6 GB) が正直な推奨 — 7BモデルとアプリとOSに十分な余裕。Small(4 GB)は3Bに留めれば動きます。それ以下はOSとコンテキストが食い込むと窮屈です。

なぜここでやるか

LLMを自ホストするなら、プライバシーがたいてい理由の半分 — なので箱を借りるのにIDを渡すのは奇妙です。渡さなくていい:USDCまたはUSDTで払え(あるいはオンランプ経由のカード)、KYCなし、サーバーは約1分であなたのもの。暗号ネイティブ、エージェント親和、そしてデータはあなたが制御するマシンに留まります。

トレードオフは私たちが正直だったもの:CPUのみ、6 GBの天井、小さなモデル。その範囲で、自ホストは素晴らしい。その外では、GPUが要る仕事にCPUの箱を誰かに売らせないこと。

試す準備はいい?プランを選び、払えば、約60秒でrootを得ます — それから自分のプライベートモデルまで三つのコマンドです。

FAQ

GPUなしでLLMを動かせますか?

はい、小さなモデルなら。4ビット量子化の3Bや7BモデルはCPUで動き、読める速さで答えます — チャットボット、コーディングの助手、カーソルを見ていない背景タスクには問題なし。CPUでできないのは大きなモデル(13B以上)を提供したり高いスループットを押すこと;そこでGPUが任意でなくなります。

Llama 7BにRAMはどれくらい要りますか?

4ビットの7Bモデルに、コンテキストウィンドウとOSを足して約5 GB — なので6 GBの箱が快適な下限です。3Bモデルは約3 GBに収まります。小さな量子化(Q4)は少しの品質をずっと少ないメモリと引き換えにし、VPSでは正しい取引です。

LLMの自ホストはAPIより安いですか?

量次第です。ホスト型APIはトークンごとに課金し、遊んでいると何もかかりません;VPSは使おうと使うまいと定額の月額です。安定した流れのリクエストを走らせるか、主にプライバシーとレート制限なしを気にするなら、自ホストが勝ちます。たまの単発プロンプトには、計量APIが安い。

クラウドAPIを使う代わりに自ホストするのはなぜ?

人々が実際にやる三つの理由:データがサーバーを決して出ない(法務、医療、あるいは単なる私的メモに現実的)、レート制限やトークンごとの計量がない、そしてモデルがあなたの下で変わったり非推奨になったりしない。コストは、あなたが箱を管理しそのハードウェアの中で生きること。

CPU VPSで現実的に動かせる最大のモデルは?

6 GBの箱で4ビットの7Bモデルがスイートスポット。技術的には十分なRAMで13Bをロードできますが、CPUでは感じるほど遅くなります。その先はGPUが欲しくなり、それは別種のホストです。

コメント

まだコメントはありません。最初になりましょう。

コメントを残す

コメントは表示される前にモデレートされます。