すべてのプロンプトを誰かのAPIに送るのは問題ありません — そうでなくなるまでは。データが機微でサーバーを決して出したくないかも。レート制限に、あるいはモデルバージョンが足元で変わることに、実験中にトークンごとの計量が刻むことに疲れたかも。ある時点で「自分のを動かしたら?」が思考実験でなくなります。
Ollama がそれを本当に簡単にします。より難しい問いは VPSに何が収まるか — そしてここでは正直な答えが誇張より大事です。
CPUで実際に何を動かせるか
GPUなし?ならCPU推論をしていて、モデルサイズがすべてです。量子化(重みを4ビットに絞る)がこれを実用的にします — 品質のかけらを失い、メモリの山を節約します。
おおよその数字、大事なもの:
- 3Bモデル、4ビット — ~3 GB RAM。チャットや簡単なタスクに十分軽快。
- 7Bモデル、4ビット — ~5 GB RAM。スイートスポット:目に見えて賢く、なお読める速さで動く。
- 13B以上 — 8-10 GB以上でCPUでは遅い。技術的には可能、実用的には煩わしい。
速さ、正直に:数vCPUで毎秒数トークンを見ます。読みながら打たれるチャットボットやコーディングアシスタントには完璧に問題なし。100万文書のバッチ処理には向かない — それはGPUの仕事で、私たちは装いません。GPUインスタンスは提供しません。 プランに70Bモデルや重いスループットが要るなら、CPU VPS — うちのも誰のも — は間違った道具で、一銭使う前にそれを知るべきです。
でもあなたの質問に答え決して家に電話しないプライベートな7B?それは6 GBの箱で快適に動きます。
インストール — 三つのコマンド
サーバーを立ち上げ、SSHで入り、そして:
curl -fsSL https://ollama.com/install.sh | sh # Ollamaをインストール
ollama run llama3.2:3b # 3Bモデルをプル+実行
それだけ — ターミナルでチャットしています。自分のコードから使うには、Ollamaがすでにポート11434でHTTP APIを提供します:
curl http://localhost:11434/api/generate -d '{
"model": "llama3.2:3b",
"prompt": "Summarize this changelog in two lines: ...",
"stream": false
}'
先に知っておく価値がある落とし穴一つ:既定でそのAPIはlocalhostにバインドします。そのままにしてSSHでトンネルするか、さもないとインターネットに晒されます。到達可能にしたいなら認証の後ろに置きましょう — 公開IPに開いたモデルエンドポイントを残さないこと。
箱を選ぶ
プランをモデルに合わせる、逆ではなく:
| 動かしたいもの | 必要なRAM | 妥当なプラン |
|---|---|---|
| 3Bモデル、軽い利用 | ~3 GB | Small(4 GB) |
| 7Bモデル、快適に | ~5-6 GB | Medium(6 GB) |
| より大きい / 高スループット | GPU領域 | CPU VPSではない |
ほとんどの自ホスト勢には、Medium(6 GB) が正直な推奨 — 7BモデルとアプリとOSに十分な余裕。Small(4 GB)は3Bに留めれば動きます。それ以下はOSとコンテキストが食い込むと窮屈です。
なぜここでやるか
LLMを自ホストするなら、プライバシーがたいてい理由の半分 — なので箱を借りるのにIDを渡すのは奇妙です。渡さなくていい:USDCまたはUSDTで払え(あるいはオンランプ経由のカード)、KYCなし、サーバーは約1分であなたのもの。暗号ネイティブ、エージェント親和、そしてデータはあなたが制御するマシンに留まります。
トレードオフは私たちが正直だったもの:CPUのみ、6 GBの天井、小さなモデル。その範囲で、自ホストは素晴らしい。その外では、GPUが要る仕事にCPUの箱を誰かに売らせないこと。
試す準備はいい?プランを選び、払えば、約60秒でrootを得ます — それから自分のプライベートモデルまで三つのコマンドです。
コメント
まだコメントはありません。最初になりましょう。