Jawaban jujur untuk "berapa server yang dibutuhkan agen AI saya?" adalah: lebih sedikit dari yang Anda kira — tepat sampai tiba-tiba tidak. Triknya adalah tahu di sisi mana garis itu beban kerja Anda duduk. Jadi alih-alih menebak, berikut apa yang sebenarnya dipakai tiap jenis agen.
Satu pertanyaan yang menentukan segalanya
Apakah model berjalan di server Anda, atau agen Anda memanggil model lewat API?
Jika agen Anda berbicara dengan LLM ter-host (kasus umum), bagian yang cerdas dan mahal terjadi di perangkat keras orang lain. Mesin Anda hanya menjalankan lingkaran orkestrasi: ambil input, panggil API, parse hasilnya, mungkin akses basis data, ulangi. Itu ringan. Benar-benar ringan — mesin 1 GB melakukannya tanpa berkeringat.
Jika Anda menjalankan model secara lokal, segalanya berubah: sekarang RAM didominasi oleh bobot model, dan Anda akan mau setiap inti yang bisa Anda dapat. Kebanyakan orang tidak membutuhkan ini. Yang membutuhkan biasanya tahu persis mengapa (privasi, tanpa batas tarif, offline). Jika itu Anda, kami menulis panduan terpisah soal swa-hosting LLM lokal.
Penentuan ukuran menurut beban kerja
Angka nyata, jenis yang bisa Anda tindaklanjuti:
| Beban kerja | RAM | vCPU | Disk | Catatan |
|---|---|---|---|---|
| Agen chat / asisten (didukung-API) | 1 GB | 2 | 15 GB | Lingkarannya mungil; modelnya jarak-jauh |
| Agen scraper / data | 2 GB | 2 | 25 GB | Margin untuk parsing + data scraping |
| Bot trading | 1–2 GB | 2 | 15–25 GB | Latensi lebih penting dari ukuran — lihat panduan bot trading |
| Beberapa agen paralel | 4 GB | 4 | 35 GB | Tiap agen murah; konkurensi menumpuk |
| LLM lokal, 3B–7B (terkuantisasi) | 4–6 GB | 4–6 | 25–45 GB | Hanya CPU, berjalan dengan laju yang dapat dibaca, bukan massal |
Polanya: agen didukung-API itu mungil; model lokal adalah satu-satunya yang berat.
Di mana mesin CPU berhenti
Berterus-terang soal plafonnya: paket kami maksimal di 6 GB RAM dan 6 inti, hanya-CPU — tanpa GPU. Itu menutupi semua di tabel di atas, termasuk model lokal 7B untuk pemakaian pribadi. Yang tidak ditutupinya: model 13B+, inferensi lokal throughput-tinggi, atau apa pun yang benar-benar butuh GPU. Jika itu beban kerja Anda, VPS CPU — kami atau siapa pun — adalah alat yang salah, dan lebih baik tahu itu sekarang daripada setelah Anda men-deploy.
Untuk 95% agen yang memanggil API, tidak ada dari ini masalah. Mereka senang di mesin terkecil.
Aturan praktis
- Sekadar agen yang memanggil API? Mulai di 1 GB / 2 inti. Anda bisa mengubah ukuran nanti.
- Scraping atau menyimpan data? 2 GB dan disk lebih besar.
- Menjalankan beberapa agen, atau model lokal kecil? 4–6 GB dan 4+ inti.
- Butuh GPU? Kategori berbeda — jangan memaksakannya ke CPU.
Jangan melebih-siapkan karena gugup. Agen ringan secara alami; biaya mesin terlalu-kecil adalah satu pengubahan ukuran, sementara biaya mesin terlalu-besar adalah membayar RAM menganggur tiap bulan.
Saat Anda telah memilih ukuran, agen bisa menyewa mesin sendiri lewat MCP, atau Anda bisa memesannya dalam satu menit di situs. Bagaimanapun, mulai kecil — Anda hampir pasti akan butuh lebih sedikit dari yang Anda harapkan.
Komentar
Belum ada komentar. Jadilah yang pertama.