がっかりする部分を先に片づけましょう、インターネットはそうしないページで一杯だからです。
私たちのサーバーはCPUのみです。GPUは提供しません。 つまりここでのローカルLLM作業には固い天井があり、そうでないふりをするのはただお金の無駄です。
CPUで実際に動くもの
最大6 vCPUと6 GBのRAM(私たちの Mediumプラン — 月$12)で、あなたは 小さな量子化モデル の範囲にいます:
- 1B〜3Bモデル(Q4): 本当に使える。分類、タグ付け、ルーティング、単純な構造化抽出に十分速い。
- 7B〜8Bモデル(Q4): 動くが、毎秒数トークンを見込んで。夜通し文書を噛み砕くキューには問題なし。チャットウィンドウとしては辛い。
- 埋め込みモデル: 優れた合致。小さく、CPUで速く、これがおそらくうちのような箱でOllamaを動かす単一の最良の理由です。
- 13B以上: やめましょう。スワップして待つことになります。
速く対話的な70Bチャットが要るなら、GPUホストが要ります — それは別の提供者の別の製品で、あなたの$12を取るより、そう言うほうを選びます。
CPUの箱が本当に勝つ場所
プライバシー。 あなたの文書、プロンプト、埋め込み — 制御するマシンを決して離れず、誰かの訓練データにならない。多くの人にはそれが全体の要点で、毎秒数トークンは受け入れられる取引です。
コストの予測可能性。 トークンごとの請求なし。五万レコードを分類するパイプラインが、五十を分類するのと同じコスト:$12。
非同期作業。 最も役立つLLM作業はチャットウィンドウではありません。キューです:これらを要約、あれらをタグ付け、このコーパスを埋め込む。CPUの箱が夜通しバックログを挽くのは、それにまったく向いています。
セットアップ
# Ubuntu 24.04 — Mediumプラン推奨
curl -fsSL https://ollama.com/install.sh | sh
# 小さなものから始めて自分で見る
ollama pull llama3.2:3b
ollama run llama3.2:3b "Summarize this in one sentence: ..."
# 埋め込み — CPUのスイートスポット
ollama pull nomic-embed-text
curl http://localhost:11434/api/embeddings \
-d '{"model":"nomic-embed-text","prompt":"hello world"}'
Ollamaは localhost:11434 でHTTP APIを提供します。そこに保ちましょう。よそから到達する必要があれば、専用IPプラン で認証付きのリバースプロキシの後ろに置きます — 認証なしのモデルエンドポイントを開いたインターネットに決して晒さないこと。
ベクトルデータベースと組み合わせれば(DockerのQdrantやpgvector)、一台の$12の箱に完全なプライベートRAGスタックができます。その組み合わせ — 小さなローカル埋め込み、ローカルのベクトルストア、重い生成ステップだけ外部API — が、このようなハードウェアで実際に理にかなう構成です。
プランを選ぶ
| 用途 | プラン | 価格 |
|---|---|---|
| 埋め込み、1〜3Bモデル、RAGパイプライン | Medium | 月$12 |
| 同じ、加えて認証の後ろの公開エンドポイント | Medium-IP | 月$20 |
| 小さなモデルをテストするだけ | Small | 月$8 |
CPUのみ、最大6 vCPUと6 GB RAM。NVMeストレージ、無計測トラフィック、ドイツかフィンランド。暗号決済、KYCなし。年払いは12回ではなく1回の送金です。
関連する読み物
- AI記憶用のベクトルDBをホストする — プライベートRAGスタックのもう半分
- AIエージェント向けVPS — 同じ箱でのオーケストレーション
準備はいい? サーバーをデプロイ → — 約1分で稼働、暗号通貨で支払い、ID不要。
コメント
まだコメントはありません。最初になりましょう。