Ollama はローカルモデルの実行を1行のインストールにします。これはハウツーです。CPU 推論に何ができて何ができないか(そして RAG のスイートスポット)の正直な姿は、Ollama 向け VPS ユースケース と Ollama をセルフホスト を参照してください。
1. Ollama をインストールする
curl -fsSL https://ollama.com/install.sh | sh
これで Ollama がインストールされ、localhost:11434 で待ち受ける systemd サービスとして起動します。
2. 小さなモデルを取得して実行する
CPU マシンでは小さく始めます:
ollama pull llama3.2:3b
ollama run llama3.2:3b "Summarize this in one sentence: ..."
3B モデルは CPU で本当に使えます。7〜8B は毎秒数トークンで動きます(バッチには良いが、チャットにはつらい)。13B+ はスワップして這うように遅くなります——やめましょう。
3. HTTP API を呼ぶ
curl http://localhost:11434/api/generate \
-d '{"model":"llama3.2:3b","prompt":"ping","stream":false}'
埋め込みは CPU のスイートスポットです:
ollama pull nomic-embed-text
curl http://localhost:11434/api/embeddings \
-d '{"model":"nomic-embed-text","prompt":"hello world"}'
4. localhost にとどめる——必要なら安全に公開する
Ollama は既定で 127.0.0.1:11434 にバインドします。そのままにしてください。 別のマシンから到達する必要があるなら、専用 IP プラン で認証付きリバースプロキシを前に置くか(nginx + HTTPS ガイド)、SSH トンネルを使います——認証のないモデルのエンドポイントを決して公に公開しないでください。
正直な部分
これらは CPU のみ のインスタンスです(GPU なし)。小さな量子化モデルと埋め込みはよく動きます。大きなモデルは動きません。Ollama を プライベート RAG スタック向けのベクトル DB と組み合わせましょう——小さなローカル埋め込みとローカルのベクトルストアが、ここで本当に輝く構成です。Medium(月 $12、6 GB) が快適なプランです。約1分で root、KYC なし、暗号資産で支払い。
コメント
まだコメントはありません。最初になりましょう。