Panas musim panas — semuanya meleleh, bahkan harga kami.−25%−25% pada setiap paket tahunan, hingga 31 AgustusLihat paket
EQVPS
Mulai

Swa-hosting LLM lokal di VPS dengan Ollama — apa yang sebenarnya bekerja

14 Jun 2026 · 3 mnt baca · EQVPS Team

Mengirim setiap prompt ke API orang lain itu baik — sampai tidak lagi. Mungkin datanya sensitif dan Anda lebih suka ia tidak pernah meninggalkan server Anda. Mungkin Anda lelah dengan batas tarif, atau versi model berubah di bawah kaki Anda, atau meter per-token berdetak saat Anda bereksperimen. Pada suatu titik "bagaimana jika saya menjalankan milik saya sendiri?" berhenti menjadi eksperimen pikiran.

Ollama membuat itu benar-benar mudah. Pertanyaan yang lebih sulit adalah apa yang muat di VPS — dan di sini jawaban jujur lebih penting daripada hype.

Apa yang sebenarnya bisa Anda jalankan di CPU

Tanpa GPU? Maka Anda melakukan inferensi CPU, dan ukuran model adalah segalanya. Kuantisasi (memeras bobot ke 4-bit) adalah yang membuat ini praktis — Anda kehilangan sepercik kualitas dan menghemat setumpuk memori.

Angka kasar, yang penting:

Kecepatan, jujurnya: pada beberapa vCPU Anda akan melihat segenggam token per detik. Sepenuhnya baik untuk chatbot atau asisten coding di mana Anda membaca saat ia mengetik. Tidak baik untuk memproses-batch sejuta dokumen — itu pekerjaan GPU, dan kami tidak berpura-pura sebaliknya. Kami tidak menawarkan instansi GPU. Jika paket Anda butuh model 70B atau throughput berat, VPS CPU — kami atau siapa pun — adalah alat yang salah, dan Anda harus tahu itu sebelum Anda menghabiskan satu sen.

Tapi 7B privat yang menjawab pertanyaan Anda dan tidak pernah menelepon pulang? Itu berjalan nyaman pada mesin 6 GB.

Instalasi — tiga perintah

Nyalakan server, SSH masuk, dan:

curl -fsSL https://ollama.com/install.sh | sh   # memasang Ollama
ollama run llama3.2:3b                            # menarik + menjalankan model 3B

Itu saja — Anda mengobrol di terminal. Untuk memakainya dari kode Anda sendiri, Ollama sudah menyajikan API HTTP di port 11434:

curl http://localhost:11434/api/generate -d '{
  "model": "llama3.2:3b",
  "prompt": "Summarize this changelog in two lines: ...",
  "stream": false
}'

Satu jebakan yang layak diketahui di depan: secara bawaan API itu terikat ke localhost. Jaga begitu dan tunnel lewat SSH, atau ia terekspos ke internet. Jika Anda ingin ia dapat dijangkau, taruh di balik auth — jangan tinggalkan endpoint model terbuka pada IP publik.

Memilih mesin

Cocokkan paket ke model, bukan sebaliknya:

Yang ingin Anda jalankanRAM yang Anda butuhkanPaket masuk akal
Model 3B, pemakaian ringan~3 GBSmall (4 GB)
Model 7B, dengan nyaman~5-6 GBMedium (6 GB)
Lebih besar / throughput tinggiWilayah GPUbukan VPS CPU

Untuk kebanyakan swa-hoster, Medium (6 GB) adalah rekomendasi jujurnya — cukup margin untuk model 7B plus app Anda dan OS. Small (4 GB) bekerja jika Anda tetap di 3B. Apa pun di bawah itu terlalu ketat begitu OS dan konteks makan.

Mengapa melakukannya di sini

Jika Anda swa-hosting LLM, privasi biasanya separuh alasannya — jadi akan aneh menyerahkan identitas Anda untuk menyewa mesinnya. Anda tidak harus: Anda bisa membayar dengan USDC atau USDT (atau kartu lewat on-ramp), tanpa KYC, dan server milik Anda dalam sekitar satu menit. Kripto-native, ramah-agen, dan data tetap di mesin yang Anda kendalikan.

Pertukarannya adalah yang telah kami jujuri: hanya CPU, plafon 6 GB, model kecil. Dalam itu, swa-hosting bagus. Di luarnya, jangan biarkan siapa pun menjual Anda mesin CPU untuk pekerjaan yang butuh GPU.

Siap mencoba? Pilih paket, bayar, dan Anda akan punya root dalam sekitar 60 detik — lalu tinggal tiga perintah ke model privat Anda sendiri.

Pertanyaan umum

Bisakah saya menjalankan LLM tanpa GPU?

Ya, untuk model kecil. Model 3B atau 7B dalam kuantisasi 4-bit berjalan di CPU dan menjawab dengan laju yang dapat dibaca — baik untuk chatbot, pembantu coding, atau tugas latar belakang di mana Anda tidak mengawasi kursor. Yang tidak bisa Anda lakukan di CPU adalah menyajikan model besar (13B ke atas) atau mendorong throughput tinggi; di situlah GPU berhenti menjadi opsional.

Berapa RAM yang saya butuhkan untuk Llama 7B?

Sekitar 5 GB untuk model 7B 4-bit begitu Anda menambahkan jendela konteks dan OS — jadi mesin 6 GB adalah lantai yang nyaman. Model 3B muat dalam sekitar 3 GB. Kuant lebih kecil (Q4) menukar sedikit kualitas untuk jauh lebih sedikit memori, yang merupakan pertukaran yang tepat di VPS.

Apakah swa-hosting LLM lebih murah dari API?

Tergantung volume. API ter-host menagih per token dan tidak berbiaya saat menganggur; VPS adalah tagihan bulanan tetap entah Anda memakainya atau tidak. Jika Anda menjalankan aliran permintaan yang stabil, atau Anda terutama peduli privasi dan tanpa batas tarif, swa-hosting menang. Untuk prompt sekali sesekali, API terukur lebih murah.

Mengapa swa-hosting alih-alih memakai API cloud?

Tiga alasan orang sebenarnya melakukannya: data tidak pernah meninggalkan server Anda (nyata untuk legal, medis, atau sekadar catatan privat), tidak ada batas tarif atau meter per-token, dan model tidak akan berubah atau ditinggalkan di bawah Anda. Biayanya adalah Anda mengelola mesin dan hidup dalam perangkat kerasnya.

Apa model terbesar yang realistis bisa saya jalankan di VPS CPU?

Model 7B dalam 4-bit adalah titik ideal pada mesin 6 GB. Anda secara teknis bisa memuat 13B dengan RAM cukup, tapi di CPU ia menjadi cukup lambat hingga Anda merasakannya. Melewati itu Anda mau GPU, yang merupakan jenis host berbeda.

← Kembali ke blogLihat paket dan harga →

Komentar

Belum ada komentar. Jadilah yang pertama.

Tinggalkan komentar

Komentar dimoderasi sebelum muncul.