Mengirim setiap prompt ke API orang lain itu baik — sampai tidak lagi. Mungkin datanya sensitif dan Anda lebih suka ia tidak pernah meninggalkan server Anda. Mungkin Anda lelah dengan batas tarif, atau versi model berubah di bawah kaki Anda, atau meter per-token berdetak saat Anda bereksperimen. Pada suatu titik "bagaimana jika saya menjalankan milik saya sendiri?" berhenti menjadi eksperimen pikiran.
Ollama membuat itu benar-benar mudah. Pertanyaan yang lebih sulit adalah apa yang muat di VPS — dan di sini jawaban jujur lebih penting daripada hype.
Apa yang sebenarnya bisa Anda jalankan di CPU
Tanpa GPU? Maka Anda melakukan inferensi CPU, dan ukuran model adalah segalanya. Kuantisasi (memeras bobot ke 4-bit) adalah yang membuat ini praktis — Anda kehilangan sepercik kualitas dan menghemat setumpuk memori.
Angka kasar, yang penting:
- Model 3B, 4-bit — ~3 GB RAM. Cukup gesit untuk chat dan tugas sederhana.
- Model 7B, 4-bit — ~5 GB RAM. Titik idealnya: terasa lebih pintar, masih berjalan dengan laju yang dapat dibaca.
- 13B ke atas — 8-10 GB+ dan lambat di CPU. Secara teknis mungkin, praktisnya menjengkelkan.
Kecepatan, jujurnya: pada beberapa vCPU Anda akan melihat segenggam token per detik. Sepenuhnya baik untuk chatbot atau asisten coding di mana Anda membaca saat ia mengetik. Tidak baik untuk memproses-batch sejuta dokumen — itu pekerjaan GPU, dan kami tidak berpura-pura sebaliknya. Kami tidak menawarkan instansi GPU. Jika paket Anda butuh model 70B atau throughput berat, VPS CPU — kami atau siapa pun — adalah alat yang salah, dan Anda harus tahu itu sebelum Anda menghabiskan satu sen.
Tapi 7B privat yang menjawab pertanyaan Anda dan tidak pernah menelepon pulang? Itu berjalan nyaman pada mesin 6 GB.
Instalasi — tiga perintah
Nyalakan server, SSH masuk, dan:
curl -fsSL https://ollama.com/install.sh | sh # memasang Ollama
ollama run llama3.2:3b # menarik + menjalankan model 3B
Itu saja — Anda mengobrol di terminal. Untuk memakainya dari kode Anda sendiri, Ollama sudah menyajikan API HTTP di port 11434:
curl http://localhost:11434/api/generate -d '{
"model": "llama3.2:3b",
"prompt": "Summarize this changelog in two lines: ...",
"stream": false
}'
Satu jebakan yang layak diketahui di depan: secara bawaan API itu terikat ke localhost. Jaga begitu dan tunnel lewat SSH, atau ia terekspos ke internet. Jika Anda ingin ia dapat dijangkau, taruh di balik auth — jangan tinggalkan endpoint model terbuka pada IP publik.
Memilih mesin
Cocokkan paket ke model, bukan sebaliknya:
| Yang ingin Anda jalankan | RAM yang Anda butuhkan | Paket masuk akal |
|---|---|---|
| Model 3B, pemakaian ringan | ~3 GB | Small (4 GB) |
| Model 7B, dengan nyaman | ~5-6 GB | Medium (6 GB) |
| Lebih besar / throughput tinggi | Wilayah GPU | bukan VPS CPU |
Untuk kebanyakan swa-hoster, Medium (6 GB) adalah rekomendasi jujurnya — cukup margin untuk model 7B plus app Anda dan OS. Small (4 GB) bekerja jika Anda tetap di 3B. Apa pun di bawah itu terlalu ketat begitu OS dan konteks makan.
Mengapa melakukannya di sini
Jika Anda swa-hosting LLM, privasi biasanya separuh alasannya — jadi akan aneh menyerahkan identitas Anda untuk menyewa mesinnya. Anda tidak harus: Anda bisa membayar dengan USDC atau USDT (atau kartu lewat on-ramp), tanpa KYC, dan server milik Anda dalam sekitar satu menit. Kripto-native, ramah-agen, dan data tetap di mesin yang Anda kendalikan.
Pertukarannya adalah yang telah kami jujuri: hanya CPU, plafon 6 GB, model kecil. Dalam itu, swa-hosting bagus. Di luarnya, jangan biarkan siapa pun menjual Anda mesin CPU untuk pekerjaan yang butuh GPU.
Siap mencoba? Pilih paket, bayar, dan Anda akan punya root dalam sekitar 60 detik — lalu tinggal tiga perintah ke model privat Anda sendiri.
Komentar
Belum ada komentar. Jadilah yang pertama.