Panas musim panas — semuanya meleleh, bahkan harga kami.−25%−25% pada setiap paket tahunan, hingga 31 AgustusLihat paket
EQVPS
Mulai

Hosting inferensi LLM lokal secara privat: apa yang bisa dan tidak bisa dilakukan VPS CPU

9 Agu 2026 · 2 mnt baca · EQVPS Team

Mari jujur di depan: jika Anda ingin generasi cepat, murah, berkualitas-tinggi, panggil API. VPS CPU tidak akan mengalahkan pusat data penuh GPU, dan siapa pun yang mengatakan sebaliknya sedang menjual sesuatu.

Jadi mengapa swa-hosting inferensi sama sekali? Satu alasan, dan itu alasan bagus: model di server Anda tidak pernah mengirim prompt Anda ke mana pun.

Seperti apa inferensi CPU sebenarnya

Anda bisa menjalankan model nyata di CPU dengan RAM cukup. Model 7–8B yang dikuantisasi ke 4-bit bekerja. 13B bekerja. Anda bahkan bisa mendorong model kelas 30B jika Anda punya memorinya. Yang tidak bisa Anda lakukan adalah membuatnya cepat — output datang pada beberapa token per detik, bukan aliran seketika yang diberikan API.

Itu pertukaran jujurnya. Untuk chat interaktif itu membuat frustrasi. Untuk kerja latar belakang — meringkas dokumen semalaman, mengklasifikasikan antrean, memperkaya data terjadwal — beberapa token per detik sepenuhnya baik, dan tidak ada yang mengawasi jam.

Matematika RAM

Model harus berada di memori, terkuantisasi atau tidak, plus overhead untuk konteks dan runtime:

Inilah mengapa "menjalankan model lokal" diam-diam menjadi pertanyaan memori-tinggi. Model adalah jejak memorinya. Tambahkan indeks RAG atau agen di mesin yang sama dan angka-angka menumpuk.

Ollama vs vLLM, singkatnya

Ollama adalah pintu masuk mudah — pasang, ollama run, selesai. Ia alat yang tepat untuk penyiapan privat pengguna-tunggal di mana Anda hanya ingin model tersedia. vLLM dibangun untuk throughput penyajian: lebih banyak penyiapan, lebih baik di bawah beban serentak, sepadan saat Anda benar-benar menangani volume. Mulai dengan Ollama; raih vLLM saat Anda menyajikan lalu lintas nyata.

Di mana privat-dulu sebenarnya menang

Argumen untuk inferensi swa-hosting bukan kecepatan atau biaya — melainkan bahwa sebagian data tidak bisa keluar. Dokumen legal. Rekam medis. Kode berpemilik. Apa pun di mana mengirim prompt ke API pihak-ketiga tidak mungkin karena alasan kebijakan atau kepercayaan. Model lebih lambat yang berjalan sepenuhnya di mesin Anda mengalahkan yang cepat yang mencatat semua yang Anda kirim.

Dan jika data sesensitif itu, pembayarannya mungkin juga harus privat. Menyewa mesin dengan kripto dan tanpa KYC menjaga seluruh rantai — server, model, prompt, penagihan — keluar dari catatan identitas siapa pun. Itulah argumen sebenarnya: bukan "inferensi lebih murah," tapi "inferensi yang tidak bisa dilihat siapa pun."

Kesimpulan

Untuk kecepatan dan kualitas, pakai API — tidak ada rasa malu di situ. Swa-hosting saat privasi adalah persyaratan dan lebih lambat dapat diterima. Tentukan ukuran untuk model plus konteksnya plus apa pun yang lain berbagi mesin, dan jangan harapkan kecepatan GPU dari CPU.

Saat model butuh memori nyata, lini Pro menjalankan 32 hingga 80 GB dengan IP khusus dan cadangan malam — cukup untuk menahan model terkuantisasi serius dengan ruang untuk konteks di sekitarnya.

Pertanyaan umum

Bisakah saya menjalankan LLM tanpa GPU?

Model kecil terkuantisasi, ya — dan dengan lambat. Model 7–8B yang dikuantisasi ke 4-bit berjalan di CPU dengan RAM cukup, tapi Anda akan mengukur output dalam beberapa token per detik, bukan aliran gesit yang Anda dapat dari API. Baik untuk pekerjaan batch dan tugas latar belakang, menyakitkan untuk chat interaktif.

Berapa RAM untuk inferensi lokal?

Model harus muat di memori plus overhead. Model 7–8B 4-bit ingin ~6–8 GB; 13B sekitar 10–16 GB; model kelas 30B mendorong 24–48 GB terkuantisasi. Tambahkan ruang untuk konteks dan apa pun yang lain di mesin. Inilah mengapa inferensi lokal mendarat di wilayah memori-tinggi dengan cepat.

Ollama atau vLLM?

Ollama adalah on-ramp mudah — satu perintah, model ditarik, berjalan. vLLM untuk throughput dan penyajian, lebih banyak penyiapan, lebih baik di bawah beban. Untuk mesin privat pengguna-tunggal, Ollama biasanya pilihan yang tepat; vLLM saat Anda benar-benar menyajikan permintaan dalam volume.

Mengapa swa-hosting inferensi sama sekali jika lebih lambat?

Privasi. Prompt dan output Anda tidak pernah menyentuh server atau log penyedia. Untuk data sensitif — legal, medis, kode internal, apa pun yang tidak bisa Anda kirim ke pihak ketiga — model privat yang lebih lambat mengalahkan yang cepat yang melihat segalanya. Gabungkan dengan pembayaran kripto tanpa KYC dan seluruh rantai tetap milik Anda.

← Kembali ke blogLihat paket dan harga →

Komentar

Belum ada komentar. Jadilah yang pertama.

Tinggalkan komentar

Komentar dimoderasi sebelum muncul.