Mari selesaikan bagian yang mengecewakan, karena internet penuh halaman yang tidak.
Server kami hanya CPU. Kami tidak menawarkan GPU. Itu berarti kerja LLM lokal di sini punya plafon keras, dan berpura-pura sebaliknya hanya akan membuang uang Anda.
Apa yang sebenarnya bekerja di CPU
Dengan hingga 6 vCPU dan 6 GB RAM (paket Medium kami — $12/bln), Anda dalam rentang model kecil terkuantisasi:
- Model 1B–3B (Q4): benar-benar dapat dipakai. Cukup cepat untuk klasifikasi, penandaan, perutean, dan ekstraksi terstruktur sederhana.
- Model 7B–8B (Q4): berjalan, tapi harapkan beberapa token per detik. Baik untuk antrean yang mengunyah dokumen semalaman. Menyakitkan sebagai jendela chat.
- Model embedding: kecocokan sangat baik. Mereka kecil, cepat di CPU, dan ini mungkin alasan tunggal terbaik menjalankan Ollama di mesin seperti kami.
- 13B ke atas: jangan. Anda akan swap dan menunggu.
Jika Anda butuh chat 70B interaktif yang cepat, Anda butuh host GPU — itu produk berbeda dari penyedia berbeda, dan kami lebih suka memberi tahu Anda daripada mengambil $12 Anda.
Di mana mesin CPU benar-benar menang
Privasi. Dokumen Anda, prompt Anda, embedding Anda — tidak pernah meninggalkan mesin yang Anda kendalikan, tidak pernah menjadi data pelatihan seseorang. Bagi banyak orang itu seluruh intinya, dan beberapa token per detik adalah pertukaran yang dapat diterima.
Prediktabilitas biaya. Tanpa tagihan per-token. Pipeline yang mengklasifikasikan lima puluh ribu catatan berbiaya sama dengan yang mengklasifikasikan lima puluh: $12.
Kerja asinkron. Kerja LLM paling berguna bukan jendela chat. Ia antrean: ringkas ini, tandai itu, embed korpus ini. Mesin CPU menggiling melewati backlog semalaman sangat bagus di itu.
Setup
# Ubuntu 24.04 — paket Medium disarankan
curl -fsSL https://ollama.com/install.sh | sh
# Mulai dengan sesuatu yang kecil dan lihat sendiri
ollama pull llama3.2:3b
ollama run llama3.2:3b "Summarize this in one sentence: ..."
# Embedding — titik ideal untuk CPU
ollama pull nomic-embed-text
curl http://localhost:11434/api/embeddings \
-d '{"model":"nomic-embed-text","prompt":"hello world"}'
Ollama menyajikan API HTTP di localhost:11434. Jaga di sana. Jika Anda perlu menjangkaunya dari tempat lain, taruh di balik reverse proxy dengan autentikasi pada paket IP-khusus — jangan pernah ekspos endpoint model tanpa-autentikasi ke internet terbuka.
Padukan dengan basis data vektor (Qdrant atau pgvector di Docker) dan Anda punya stack RAG privat lengkap pada satu mesin $12. Kombinasi itu — embedding lokal kecil, penyimpanan vektor lokal, API eksternal hanya untuk langkah generasi berat — adalah setup yang sebenarnya masuk akal pada perangkat keras seperti ini.
Memilih paket
| Pemakaian | Paket | Harga |
|---|---|---|
| Embedding, model 1–3B, pipeline RAG | Medium | $12/bln |
| Sama, plus endpoint publik di balik auth | Medium-IP | $20/bln |
| Hanya menguji model kecil | Small | $8/bln |
Hanya CPU, hingga 6 vCPU dan 6 GB RAM. Penyimpanan NVMe, trafik tanpa dibatasi, Jerman atau Finlandia. Pembayaran kripto, tanpa KYC. Penagihan tahunan adalah satu transfer alih-alih dua belas.
Bacaan terkait
- Hosting BD vektor untuk memori AI — separuh lain dari stack RAG privat
- VPS untuk agen AI — orkestrasi di mesin yang sama
Siap? Deploy server → — live dalam sekitar satu menit, dibayar kripto, tanpa perlu identitas.
Komentar
Belum ada komentar. Jadilah yang pertama.