−25%

Windows 年払い、10月31日まで。 プランを見る

EQVPS
始める

OllamaとローカルLLM向けVPS

CPUサーバーで小さな言語モデルを自ホストする — プライベート、無計測、暗号通貨で支払い。CPU推論にできることとできないことに正直。月$12から。

がっかりする部分を先に片づけましょう、インターネットはそうしないページで一杯だからです。

私たちのサーバーはCPUのみです。GPUは提供しません。 つまりここでのローカルLLM作業には固い天井があり、そうでないふりをするのはただお金の無駄です。

CPUで実際に動くもの

最大6 vCPUと6 GBのRAM(私たちの Mediumプラン — 月$12)で、あなたは 小さな量子化モデル の範囲にいます:

  • 1B〜3Bモデル(Q4): 本当に使える。分類、タグ付け、ルーティング、単純な構造化抽出に十分速い。
  • 7B〜8Bモデル(Q4): 動くが、毎秒数トークンを見込んで。夜通し文書を噛み砕くキューには問題なし。チャットウィンドウとしては辛い。
  • 埋め込みモデル: 優れた合致。小さく、CPUで速く、これがおそらくうちのような箱でOllamaを動かす単一の最良の理由です。
  • 13B以上: やめましょう。スワップして待つことになります。

速く対話的な70Bチャットが要るなら、GPUホストが要ります — それは別の提供者の別の製品で、あなたの$12を取るより、そう言うほうを選びます。

CPUの箱が本当に勝つ場所

プライバシー。 あなたの文書、プロンプト、埋め込み — 制御するマシンを決して離れず、誰かの訓練データにならない。多くの人にはそれが全体の要点で、毎秒数トークンは受け入れられる取引です。

コストの予測可能性。 トークンごとの請求なし。五万レコードを分類するパイプラインが、五十を分類するのと同じコスト:$12。

非同期作業。 最も役立つLLM作業はチャットウィンドウではありません。キューです:これらを要約、あれらをタグ付け、このコーパスを埋め込む。CPUの箱が夜通しバックログを挽くのは、それにまったく向いています。

セットアップ

# Ubuntu 24.04 — Mediumプラン推奨
curl -fsSL https://ollama.com/install.sh | sh

# 小さなものから始めて自分で見る
ollama pull llama3.2:3b
ollama run llama3.2:3b "Summarize this in one sentence: ..."

# 埋め込み — CPUのスイートスポット
ollama pull nomic-embed-text
curl http://localhost:11434/api/embeddings \
  -d '{"model":"nomic-embed-text","prompt":"hello world"}'

Ollamaは localhost:11434 でHTTP APIを提供します。そこに保ちましょう。よそから到達する必要があれば、専用IPプラン で認証付きのリバースプロキシの後ろに置きます — 認証なしのモデルエンドポイントを開いたインターネットに決して晒さないこと。

ベクトルデータベースと組み合わせれば(DockerのQdrantやpgvector)、一台の$12の箱に完全なプライベートRAGスタックができます。その組み合わせ — 小さなローカル埋め込み、ローカルのベクトルストア、重い生成ステップだけ外部API — が、このようなハードウェアで実際に理にかなう構成です。

プランを選ぶ

用途プラン価格
埋め込み、1〜3Bモデル、RAGパイプラインMedium月$12
同じ、加えて認証の後ろの公開エンドポイントMedium-IP月$20
小さなモデルをテストするだけSmall月$8

CPUのみ、最大6 vCPUと6 GB RAM。NVMeストレージ、無計測トラフィック、ドイツかフィンランド。暗号決済、KYCなし。年払いは12回ではなく1回の送金です。

関連する読み物


準備はいい? サーバーをデプロイ → — 約1分で稼働、暗号通貨で支払い、ID不要。

Open WebUI 向け VPS:LLM 用のプライベートなチャット画面 →

デプロイの準備はできましたか?暗号通貨で支払い、KYC不要 — 約1分でオンライン。

今すぐデプロイ →

FAQ

これでLlama 70Bを動かせますか?

いいえ。私たちのプランはCPUのみで最大6 GBのRAM — それが小さな量子化モデルの範囲です(4ビットでおおよそ1B〜8B)。70Bモデルには GPUとはるかに多いメモリが要ります。GPUは提供せず、失望を売るよりそう言うほうを選びます。

CPU推論は実際どれくらい速いですか?

4ビット量子化の7〜8Bモデルで毎秒数トークン、1〜3Bモデルでは目に見えて良い、と見込んでください。背景ジョブ、埋め込み、分類、非同期パイプラインには問題なし。軽快な対話チャットには不向きです。

では実際何に良いのですか?

プライベートな埋め込み、分類、要約のキュー、遅延が問題にならないRAGパイプライン、そしてデータを第三者APIから遠ざけること。加えて:どこかでGPUを借りる前の学習、テスト、プロトタイプ。

IDを求めますか?

いいえ。登録はメール、支払いはUSDCかUSDT。それがしばしば、そもそも人々がプライベートなモデルを欲しがる理由です。

コメント

まだコメントはありません。最初になりましょう。

コメントを残す

コメントは表示される前にモデレートされます。