Kebanyakan orang menebak kebutuhan RAM mereka. Mereka membeli terlalu banyak “untuk berjaga-jaga” atau baru berkenalan dengan OOM killer pukul 3 pagi. Memori sebenarnya salah satu hal paling mudah untuk ditentukan ukurannya, karena beban kerja bisa diprediksi begitu Anda tahu angka kasarnya. Inilah angkanya, dari mesin 1 GB untuk bot hingga server 64 GB yang dicari orang ketika ingin menjalankan model besar secara lokal.
Angka kasar per beban kerja
Ini adalah angka nyata dalam kondisi stabil untuk penyiapan umum, bukan batas minimum dari vendor.
| Beban kerja | RAM yang benar-benar dipakai | Paket yang cocok |
|---|---|---|
| Bot Telegram/Discord (Python, Node.js) | 100–300 MB | Nano 1 GB |
| Situs statis + Caddy/Nginx | 50–150 MB | Nano 1 GB |
| WordPress + MariaDB, lalu lintas normal | 0,8–1,5 GB | Micro-IP 2 GB |
| PostgreSQL untuk aplikasi kecil | 0,5–2 GB (Anda tentukan lewat shared_buffers) | Micro / Small |
| n8n dengan beberapa workflow | 0,5–1,5 GB | Micro 2 GB |
| Host Docker dengan 5–10 layanan kecil | 2–4 GB | Small 4 GB |
| Coolify + build + database | 3–4 GB | Small-IP 4 GB |
| LLM 7–8B, 4-bit, inferensi CPU | 5–6 GB | Medium 6 GB |
| LLM 14B, 4-bit | ~10 GB | Pro-32 |
| LLM 32B, 4-bit | ~20 GB | Pro-32 |
| LLM 70B, 4-bit | ~40–45 GB | Pro-48 / Pro-64 |
Ada dua hal yang patut dicatat. Pertama, lompatan antara beban kerja “normal” dan LLM sangat besar: bot dan model 70B berbeda hingga dua ratus kali lipat. Kedua, sebagian besar layanan cukup dengan 1–4 GB; orang membeli berlebihan karena menyesuaikan ukuran untuk masa depan yang jarang tiba.
Rumus LLM
Untuk model bahasa ada perkiraan sederhana: jumlah parameter × bit per bobot ÷ 8, ditambah overhead. Model 8B pada sekitar 4,5 bit (kuantisasi Q4 yang umum) menghasilkan 8 × 4,5 ÷ 8 ≈ 4,5 GB bobot. Tambahkan 1–2 GB untuk jendela konteks (KV cache membesar seiring panjang konteks) dan runtime, dan Anda mendapatkan 5–6 GB.
Bagian jujurnya: di server khusus CPU, memori hanyalah separuh cerita. Harapkan beberapa token per detik untuk model 7–8B di beberapa vCPU dan sekitar satu token per detik untuk 70B. Itu cukup untuk pekerjaan batch, agen latar belakang, dan eksperimen pribadi; itu bukan pengalaman chat untuk banyak pengguna sekaligus. Jika Anda lebih banyak memanggil API model yang di-hosting, agen Anda butuh jauh lebih sedikit: lihat ukuran VPS untuk agen AI.
Ukur, jangan menebak
Jika Anda sudah punya server, angkanya tersedia di sana:
free -h # look at "available", not "free"
ps aux --sort=-rss | head -n 8 # the biggest processes, by resident memory
docker stats --no-stream # per-container usage
Linux memakai RAM yang menganggur sebagai cache disk, jadi “free” selalu kecil, dan itu sehat. Available adalah angka yang penting: memori yang bisa diberikan kernel kepada program saat ini juga. Jika available tetap di atas ~25% pada jam tersibuk Anda, ukurannya sudah tepat. Jika sering mencapai nol dan swap terus bertambah, naikkan paket.
Periksa juga apakah pernah terjadi OOM kill:
journalctl -k | grep -i "out of memory"
Swap: sabuk pengaman, bukan mesin
File swap 1–2 GB di server kecil adalah asuransi murah: pembaruan paket atau build Docker yang sesaat butuh lebih banyak memori bisa bertahan alih-alih dihentikan paksa. Tetapi jika sebuah layanan hidup di swap, setiap permintaan menunggu disk. Swap untuk lonjakan. Swapping terus-menerus berarti Anda butuh paket berikutnya.
Jadi, berapa yang sebaiknya dibeli?
- 1 GB: satu bot, satu API kecil, satu situs statis.
- 2 GB: pilihan standar yang masuk akal untuk apa pun yang memakai database atau Docker.
- 4–6 GB: beberapa layanan dalam satu mesin, build di server, model lokal kecil.
- 32–64 GB: hanya ketika satu hal besar harus hidup di memori: model lokal di atas 14B, indeks RAG besar, armada agen. Untuk itulah paket bermemori besar tersedia.
Mulailah satu ukuran lebih kecil dari yang dikatakan naluri Anda, pantau free -h selama seminggu, dan tingkatkan jika angkanya menunjukkan begitu. Di EQVPS, upgrade paket mempertahankan data Anda dan hanya menagih selisih prorata (cara kerja perubahan paket).
Komentar
Belum ada komentar. Jadilah yang pertama.