Mari jujur di depan: jika Anda ingin generasi cepat, murah, berkualitas-tinggi, panggil API. VPS CPU tidak akan mengalahkan pusat data penuh GPU, dan siapa pun yang mengatakan sebaliknya sedang menjual sesuatu.
Jadi mengapa swa-hosting inferensi sama sekali? Satu alasan, dan itu alasan bagus: model di server Anda tidak pernah mengirim prompt Anda ke mana pun.
Seperti apa inferensi CPU sebenarnya
Anda bisa menjalankan model nyata di CPU dengan RAM cukup. Model 7–8B yang dikuantisasi ke 4-bit bekerja. 13B bekerja. Anda bahkan bisa mendorong model kelas 30B jika Anda punya memorinya. Yang tidak bisa Anda lakukan adalah membuatnya cepat — output datang pada beberapa token per detik, bukan aliran seketika yang diberikan API.
Itu pertukaran jujurnya. Untuk chat interaktif itu membuat frustrasi. Untuk kerja latar belakang — meringkas dokumen semalaman, mengklasifikasikan antrean, memperkaya data terjadwal — beberapa token per detik sepenuhnya baik, dan tidak ada yang mengawasi jam.
Matematika RAM
Model harus berada di memori, terkuantisasi atau tidak, plus overhead untuk konteks dan runtime:
- 7–8B, 4-bit — sekitar 6–8 GB. Berjalan pada paket menengah.
- 13B, 4-bit — kira-kira 10–16 GB.
- Kelas 30B, terkuantisasi — 24–48 GB, tergantung kuantisasi.
- Lebih besar, atau presisi lebih tinggi — Anda masuk ke 64–80 GB dengan cepat — dan melewati 80 GB tidak ada mesin Pro tunggal yang muat, tetap lambat-CPU.
Inilah mengapa "menjalankan model lokal" diam-diam menjadi pertanyaan memori-tinggi. Model adalah jejak memorinya. Tambahkan indeks RAG atau agen di mesin yang sama dan angka-angka menumpuk.
Ollama vs vLLM, singkatnya
Ollama adalah pintu masuk mudah — pasang, ollama run, selesai. Ia alat yang tepat untuk penyiapan privat pengguna-tunggal di mana Anda hanya ingin model tersedia. vLLM dibangun untuk throughput penyajian: lebih banyak penyiapan, lebih baik di bawah beban serentak, sepadan saat Anda benar-benar menangani volume. Mulai dengan Ollama; raih vLLM saat Anda menyajikan lalu lintas nyata.
Di mana privat-dulu sebenarnya menang
Argumen untuk inferensi swa-hosting bukan kecepatan atau biaya — melainkan bahwa sebagian data tidak bisa keluar. Dokumen legal. Rekam medis. Kode berpemilik. Apa pun di mana mengirim prompt ke API pihak-ketiga tidak mungkin karena alasan kebijakan atau kepercayaan. Model lebih lambat yang berjalan sepenuhnya di mesin Anda mengalahkan yang cepat yang mencatat semua yang Anda kirim.
Dan jika data sesensitif itu, pembayarannya mungkin juga harus privat. Menyewa mesin dengan kripto dan tanpa KYC menjaga seluruh rantai — server, model, prompt, penagihan — keluar dari catatan identitas siapa pun. Itulah argumen sebenarnya: bukan "inferensi lebih murah," tapi "inferensi yang tidak bisa dilihat siapa pun."
Kesimpulan
Untuk kecepatan dan kualitas, pakai API — tidak ada rasa malu di situ. Swa-hosting saat privasi adalah persyaratan dan lebih lambat dapat diterima. Tentukan ukuran untuk model plus konteksnya plus apa pun yang lain berbagi mesin, dan jangan harapkan kecepatan GPU dari CPU.
Saat model butuh memori nyata, lini Pro menjalankan 32 hingga 80 GB dengan IP khusus dan cadangan malam — cukup untuk menahan model terkuantisasi serius dengan ruang untuk konteks di sekitarnya.
Komentar
Belum ada komentar. Jadilah yang pertama.