Panas musim panas — semuanya meleleh, bahkan harga kami.−25%−25% pada setiap paket tahunan, hingga 31 AgustusLihat paket
EQVPS
Mulai

VPS untuk Ollama dan LLM Lokal

Swa-hosting model bahasa kecil di server CPU — privat, tanpa dibatasi, dibayar kripto. Jujur soal apa yang bisa dan tidak bisa dilakukan inferensi CPU. Mulai $12/bln.

Mari selesaikan bagian yang mengecewakan, karena internet penuh halaman yang tidak.

Server kami hanya CPU. Kami tidak menawarkan GPU. Itu berarti kerja LLM lokal di sini punya plafon keras, dan berpura-pura sebaliknya hanya akan membuang uang Anda.

Apa yang sebenarnya bekerja di CPU

Dengan hingga 6 vCPU dan 6 GB RAM (paket Medium kami — $12/bln), Anda dalam rentang model kecil terkuantisasi:

Jika Anda butuh chat 70B interaktif yang cepat, Anda butuh host GPU — itu produk berbeda dari penyedia berbeda, dan kami lebih suka memberi tahu Anda daripada mengambil $12 Anda.

Di mana mesin CPU benar-benar menang

Privasi. Dokumen Anda, prompt Anda, embedding Anda — tidak pernah meninggalkan mesin yang Anda kendalikan, tidak pernah menjadi data pelatihan seseorang. Bagi banyak orang itu seluruh intinya, dan beberapa token per detik adalah pertukaran yang dapat diterima.

Prediktabilitas biaya. Tanpa tagihan per-token. Pipeline yang mengklasifikasikan lima puluh ribu catatan berbiaya sama dengan yang mengklasifikasikan lima puluh: $12.

Kerja asinkron. Kerja LLM paling berguna bukan jendela chat. Ia antrean: ringkas ini, tandai itu, embed korpus ini. Mesin CPU menggiling melewati backlog semalaman sangat bagus di itu.

Setup

# Ubuntu 24.04 — paket Medium disarankan
curl -fsSL https://ollama.com/install.sh | sh

# Mulai dengan sesuatu yang kecil dan lihat sendiri
ollama pull llama3.2:3b
ollama run llama3.2:3b "Summarize this in one sentence: ..."

# Embedding — titik ideal untuk CPU
ollama pull nomic-embed-text
curl http://localhost:11434/api/embeddings \
  -d '{"model":"nomic-embed-text","prompt":"hello world"}'

Ollama menyajikan API HTTP di localhost:11434. Jaga di sana. Jika Anda perlu menjangkaunya dari tempat lain, taruh di balik reverse proxy dengan autentikasi pada paket IP-khusus — jangan pernah ekspos endpoint model tanpa-autentikasi ke internet terbuka.

Padukan dengan basis data vektor (Qdrant atau pgvector di Docker) dan Anda punya stack RAG privat lengkap pada satu mesin $12. Kombinasi itu — embedding lokal kecil, penyimpanan vektor lokal, API eksternal hanya untuk langkah generasi berat — adalah setup yang sebenarnya masuk akal pada perangkat keras seperti ini.

Memilih paket

PemakaianPaketHarga
Embedding, model 1–3B, pipeline RAGMedium$12/bln
Sama, plus endpoint publik di balik authMedium-IP$20/bln
Hanya menguji model kecilSmall$8/bln

Hanya CPU, hingga 6 vCPU dan 6 GB RAM. Penyimpanan NVMe, trafik tanpa dibatasi, Jerman atau Finlandia. Pembayaran kripto, tanpa KYC. Penagihan tahunan adalah satu transfer alih-alih dua belas.

Bacaan terkait


Siap? Deploy server → — live dalam sekitar satu menit, dibayar kripto, tanpa perlu identitas.

Siap deploy? Bayar dengan kripto, tanpa KYC — online dalam sekitar satu menit.

Deploy →

Pertanyaan umum

Bisakah saya menjalankan Llama 70B di ini?

Tidak. Paket kami hanya CPU dengan hingga 6 GB RAM — itu rentang model kecil terkuantisasi (kira-kira 1B–8B pada 4-bit). Model 70B butuh GPU dan jauh lebih banyak memori. Kami tidak menawarkan GPU, dan kami lebih suka mengatakannya daripada menjual Anda kekecewaan.

Secepat apa inferensi CPU, sungguhnya?

Harapkan beberapa token per detik pada model 7–8B pada kuantisasi 4-bit, dan jauh lebih baik pada model 1–3B. Itu baik untuk pekerjaan latar belakang, embedding, klasifikasi, dan pipeline asinkron. Itu tidak baik untuk chat interaktif yang gesit.

Jadi untuk apa ini sebenarnya bagus?

Embedding privat, klasifikasi, antrean peringkasan, pipeline RAG di mana latensi tidak penting, dan menjaga data keluar dari API pihak-ketiga. Juga: belajar, menguji, dan membuat prototipe sebelum Anda menyewa GPU di suatu tempat.

Apakah Anda meminta identitas?

Tidak. Email untuk mendaftar, USDC atau USDT untuk membayar. Yang sering menjadi alasan orang menginginkan model privat sejak awal.

Komentar

Belum ada komentar. Jadilah yang pertama.

Tinggalkan komentar

Komentar dimoderasi sebelum muncul.