"Yapay zekâ ajanım ne kadar sunucu ister?" sorusunun dürüst cevabı şudur: sandığından az — ta ki aniden az olmayana dek. Numara, iş yükünün o çizginin hangi tarafında oturduğunu bilmektir. O yüzden tahmin etmek yerine, işte her tür ajanın gerçekte ne kullandığı.
Her şeyi belirleyen tek soru
Model sunucunda mı çalışır, yoksa ajanın bir modeli bir API üzerinden mi çağırır?
Ajanın barındırılan bir LLM ile konuşuyorsa (olağan durum), akıllı, pahalı kısım başkasının donanımında olur. Kutun sadece bir orkestrasyon döngüsü çalıştırır: girdiyi al, API'yi çağır, sonucu ayrıştır, belki bir veritabanına vur, tekrarla. Bu hafiftir. Gerçekten hafif — 1 GB'lık bir kutu bunu hiç zorlanmadan yapar.
Modeli yerel olarak çalıştırırsan her şey değişir: artık RAM'e model ağırlıkları hâkimdir ve alabildiğin her çekirdeği istersin. Çoğu insanın buna ihtiyacı yoktur. İhtiyacı olanlar genellikle tam olarak nedenini bilir (gizlilik, hız sınırı yok, çevrim dışı). Bu sensen, yerel bir LLM'i kendin barındırma üzerine ayrı bir rehber yazdık.
İş yüküne göre boyutlandırma
Üzerine harekete geçebileceğin türden gerçek sayılar:
| İş yükü | RAM | vCPU | Disk | Notlar |
|---|---|---|---|---|
| Sohbet / asistan ajanı (API destekli) | 1 GB | 2 | 15 GB | Döngü minik; model uzakta |
| Kazıyıcı / veri ajanı | 2 GB | 2 | 25 GB | Ayrıştırma + kazınmış veri için pay |
| Alım-satım botu | 1–2 GB | 2 | 15–25 GB | Boyuttan çok gecikme önemli — bkz alım-satım botu rehberi |
| Paralel birkaç ajan | 4 GB | 4 | 35 GB | Her ajan ucuz; eşzamanlılık birikir |
| Yerel LLM, 3B–7B (nicemlenmiş) | 4–6 GB | 4–6 | 25–45 GB | Yalnızca-CPU, okunabilir hızda çalışır, toplu değil |
Desen: API destekli ajanlar minik; ağır olan tek şey yerel modeller.
Bir CPU kutusu nerede durur
Tavan konusunda açık olalım: planlarımız 6 GB RAM ve 6 çekirdekte, yalnızca-CPU — GPU yok olarak son bulur. Bu, kişisel kullanım için bir 7B yerel model dahil yukarıdaki tablodaki her şeyi kapsar. Kapsamadığı şey: 13B+ modeller, yüksek çıktılı yerel çıkarım ya da gerçekten bir GPU gerektiren herhangi bir şey. İş yükün buysa, bir CPU VPS — bizimki ya da herhangi birininki — yanlış araçtır ve bunu dağıttıktan sonra değil, şimdi bilmek daha iyidir.
Bir API çağıran ajanların %95'i için bunların hiçbiri sorun değil. En küçük kutuda mutlular.
Pratik bir genel kural
- Sadece bir API çağıran bir ajan mı? 1 GB / 2 çekirdekte başla. Sonra yeniden boyutlandırabilirsin.
- Veri kazıyor ya da saklıyor musun? 2 GB ve daha büyük bir disk.
- Birkaç ajan ya da küçük bir yerel model mi çalıştırıyorsun? 4–6 GB ve 4+ çekirdek.
- GPU mu gerekiyor? Farklı kategori — onu CPU'ya zorlama.
Gerginlikten fazla-tedarik etme. Ajanlar doğaları gereği hafiftir; fazla küçük bir kutunun maliyeti bir yeniden boyutlandırma, fazla büyük bir kutunun maliyeti ise her ay boşta RAM için ödeme yapmaktır.
Bir boyut seçtiğinde, bir ajan kutuyu MCP üzerinden kendisi kiralayabilir ya da onu sitede bir dakikada sipariş edebilirsin. Her iki durumda da küçük başla — neredeyse kesinlikle beklediğinden azına ihtiyacın olacak.
Yorumlar
Henüz yorum yok. İlk olun.