Panas musim panas — semuanya meleleh, bahkan harga kami.−25%−25% pada setiap paket tahunan, hingga 31 AgustusLihat paket
EQVPS
Mulai

VPS untuk inferensi LLM memori-tinggi privat

Model terkuantisasi lebih besar butuh RAM nyata, bukan GPU yang tidak Anda punya. Di mana mesin CPU memori-tinggi menjalankan model kelas-30B secara privat, apa yang realistis, dan di mana tidak. Mulai $70/bln.

Kami punya halaman terpisah untuk Ollama dan model kecil — itu mesin CPU $12 yang menjalankan 1B–8B dan embedding. Halaman ini ujung yang lain: model yang cukup besar hingga RAM, bukan CPU, adalah yang menghentikan Anda.

Mari jujur di depan, sama seperti di mana pun: server kami hanya CPU, tanpa GPU. Model besar di sini berjalan lambat. Jika Anda ingin chat interaktif cepat pada model 30B, Anda butuh host GPU — produk berbeda, penyedia berbeda. Yang mesin CPU memori-tinggi lakukan dengan baik adalah menjalankan model terkuantisasi besar secara privat untuk kerja yang bukan jendela chat.

Matematika RAM

Model berada di memori, terkuantisasi atau tidak, plus overhead untuk konteks dan runtime:

Itulah mengapa "menjalankan model lokal lebih besar" sebenarnya pertanyaan memori-tinggi. Model adalah jejak memorinya. Tambahkan indeks RAG di host yang sama dan angka-angka menumpuk.

Di mana privat-dulu benar-benar menang

Argumennya bukan kecepatan dan bukan biaya — melainkan bahwa sebagian data tidak bisa keluar. Dokumen legal. Rekam medis. Kode berpemilik. Apa pun di mana mengirim prompt ke API pihak-ketiga tidak mungkin. Model lebih lambat yang berjalan sepenuhnya di mesin Anda mengalahkan yang cepat yang mencatat semua yang Anda kirim. Kami menulis gambaran lengkapnya di sini.

Dan jika data sesensitif itu, pembayarannya mungkin juga harus privat. Menyewa mesin dengan kripto dan tanpa KYC menjaga seluruh rantai — server, model, prompt, penagihan — keluar dari catatan identitas siapa pun. Itulah argumennya: bukan inferensi lebih murah, tapi inferensi yang tidak bisa dilihat siapa pun.

Apa yang dipilih

Untuk model kelas-30B dengan ruang untuk konteks, Pro-64 (64 GB) adalah pilihan yang nyaman; kuantisasi lebih ketat cocok Pro-32 atau Pro-48, yang lebih besar pergi ke Pro-80. Muat model dulu, awasi memori residen, tentukan ukuran dari yang Anda ukur. Dan tetapkan ekspektasi: ini inferensi batch privat, bukan jendela chat cepat.

Siap deploy? Bayar dengan kripto, tanpa KYC — online dalam sekitar satu menit.

Deploy →

Pertanyaan umum

Apa beda ini dengan kasus-penggunaan Ollama Anda?

Halaman Ollama soal model kecil pada mesin CPU $12 — 1B–8B, embedding, kerja ringan. Ini ujung memori-tinggi: model terkuantisasi 13B hingga kelas-30B yang butuh 24–48 GB atau lebih hanya untuk memuat. Realitas hanya-CPU yang sama, jejak memori jauh lebih besar, paket berbeda.

Berapa RAM untuk model tertentu?

Model harus muat di memori plus overhead. Model 13B 4-bit mau ~10–16 GB; kelas-30B terkuantisasi mendorong 24–48 GB; naik lebih besar atau presisi-lebih-tinggi dan Anda masuk 64–80 GB — melewati itu, tidak ada mesin kami yang tunggal muat. Tambahkan ruang untuk konteks di atasnya.

Apakah akan cepat?

Tidak — jujurlah dengan diri sendiri di sini. Inferensi CPU pada model besar adalah beberapa token per detik, bukan aliran interaktif. Ia baik untuk kerja batch dan latar belakang (ringkas semalaman, klasifikasikan antrean). Untuk chat real-time pada model besar Anda butuh GPU, yang tidak kami tawarkan.

Mengapa menjalankannya di sini alih-alih API?

Privasi. Prompt dan output Anda tidak pernah menyentuh server atau log penyedia. Untuk data sensitif — legal, medis, kode internal — model privat yang lebih lambat mengalahkan yang cepat yang melihat segalanya. Padukan dengan pembayaran kripto tanpa KYC dan seluruh rantai tetap milik Anda.

Komentar

Belum ada komentar. Jadilah yang pertama.

Tinggalkan komentar

Komentar dimoderasi sebelum muncul.