Kami punya halaman terpisah untuk Ollama dan model kecil — itu mesin CPU $12 yang menjalankan 1B–8B dan embedding. Halaman ini ujung yang lain: model yang cukup besar hingga RAM, bukan CPU, adalah yang menghentikan Anda.
Mari jujur di depan, sama seperti di mana pun: server kami hanya CPU, tanpa GPU. Model besar di sini berjalan lambat. Jika Anda ingin chat interaktif cepat pada model 30B, Anda butuh host GPU — produk berbeda, penyedia berbeda. Yang mesin CPU memori-tinggi lakukan dengan baik adalah menjalankan model terkuantisasi besar secara privat untuk kerja yang bukan jendela chat.
Matematika RAM
Model berada di memori, terkuantisasi atau tidak, plus overhead untuk konteks dan runtime:
- 13B, 4-bit — kira-kira 10–16 GB. Berjalan pada paket menengah sudah.
- Kelas-30B, terkuantisasi — 24–48 GB tergantung kuantisasi. Ini wilayah Pro-32 hingga Pro-64.
- Lebih besar atau presisi lebih tinggi — 64–80 GB, dan melewati 80 GB tidak ada mesin kami yang tunggal muat. Pro-80 adalah plafon di sini.
Itulah mengapa "menjalankan model lokal lebih besar" sebenarnya pertanyaan memori-tinggi. Model adalah jejak memorinya. Tambahkan indeks RAG di host yang sama dan angka-angka menumpuk.
Di mana privat-dulu benar-benar menang
Argumennya bukan kecepatan dan bukan biaya — melainkan bahwa sebagian data tidak bisa keluar. Dokumen legal. Rekam medis. Kode berpemilik. Apa pun di mana mengirim prompt ke API pihak-ketiga tidak mungkin. Model lebih lambat yang berjalan sepenuhnya di mesin Anda mengalahkan yang cepat yang mencatat semua yang Anda kirim. Kami menulis gambaran lengkapnya di sini.
Dan jika data sesensitif itu, pembayarannya mungkin juga harus privat. Menyewa mesin dengan kripto dan tanpa KYC menjaga seluruh rantai — server, model, prompt, penagihan — keluar dari catatan identitas siapa pun. Itulah argumennya: bukan inferensi lebih murah, tapi inferensi yang tidak bisa dilihat siapa pun.
Apa yang dipilih
Untuk model kelas-30B dengan ruang untuk konteks, Pro-64 (64 GB) adalah pilihan yang nyaman; kuantisasi lebih ketat cocok Pro-32 atau Pro-48, yang lebih besar pergi ke Pro-80. Muat model dulu, awasi memori residen, tentukan ukuran dari yang Anda ukur. Dan tetapkan ekspektasi: ini inferensi batch privat, bukan jendela chat cepat.
Komentar
Belum ada komentar. Jadilah yang pertama.