Her istemi başkasının API'sine göndermek sorun değil — ta ki olana kadar. Belki veri hassastır ve sunucunuzdan hiç çıkmamasını tercih edersiniz. Belki hız sınırlarından ya da altınızda bir model sürümünün değişmesinden ya da siz denemeler yaparken tıklayan token başına bir sayaçtan bıktınız. Bir noktada "ya kendiminkini çalıştırsaydım?" bir düşünce deneyi olmaktan çıkar.
Ollama bunu gerçekten kolay kılar. Daha zor soru bir VPS'e ne sığar — ve burada dürüst cevap, abartıdan daha çok önemlidir.
CPU üzerinde gerçekte ne çalıştırabilirsiniz
GPU yok mu? O zaman CPU çıkarımı yapıyorsunuz ve model boyutu her şeydir. Kuantizasyon (ağırlıkları 4-bit'e sıkıştırmak) bunu pratik kılan şeydir — bir dilim kaliteyi kaybeder ve bir yığın bellek kurtarırsınız.
Kabaca rakamlar, önemli olanlar:
- 3B model, 4-bit — ~3 GB RAM. Sohbet ve basit görevler için yeterince çevik.
- 7B model, 4-bit — ~5 GB RAM. İdeal nokta: gözle görülür şekilde daha akıllı, hâlâ okunabilir bir hızda çalışıyor.
- 13B ve üzeri — 8-10 GB+ ve CPU üzerinde yavaş. Teknik olarak mümkün, pratikte can sıkıcı.
Hız, dürüstçe: birkaç vCPU'da saniyede bir avuç token görürsünüz. Yazarken okuduğunuz bir sohbet botu ya da bir kodlama asistanı için gayet iyi. Bir milyon belgeyi toplu işlemek için iyi değil — o bir GPU işidir ve aksini iddia etmiyoruz. GPU örnekleri sunmuyoruz. Planınız 70B'lik bir model ya da ağır verim gerektiriyorsa, bir CPU VPS'i — bizimki ya da başkasınınki — yanlış araçtır ve bunu bir kuruş harcamadan önce bilmelisiniz.
Ama sorularınıza yanıt veren ve asla eve telefon etmeyen özel bir 7B? Bu, 6 GB'lık bir kutuda rahatça çalışır.
Kurulum — üç komut
Sunucuyu oluşturun, SSH ile bağlanın ve:
curl -fsSL https://ollama.com/install.sh | sh # installs Ollama
ollama run llama3.2:3b # pulls + runs a 3B model
Hepsi bu — terminalde sohbet ediyorsunuz. Onu kendi kodunuzdan kullanmak için, Ollama zaten 11434 portunda bir HTTP API sunar:
curl http://localhost:11434/api/generate -d '{
"model": "llama3.2:3b",
"prompt": "Summarize this changelog in two lines: ...",
"stream": false
}'
Baştan bilmeye değer bir püf noktası: varsayılan olarak o API localhost'a bağlanır. Onu öyle tutun ve SSH üzerinden tünelleyin, yoksa internete açıktır. Erişilebilir olmasını istiyorsanız, onu kimlik doğrulamanın arkasına koyun — genel bir IP'de açık bir model uç noktası bırakmayın.
Kutuyu seçmek
Planı modele eşleştirin, tersini değil:
| Çalıştırmak istediğiniz | İhtiyaç duyduğunuz RAM | Mantıklı plan |
|---|---|---|
| 3B model, hafif kullanım | ~3 GB | Small (4 GB) |
| 7B model, rahatça | ~5-6 GB | Medium (6 GB) |
| Daha büyük / yüksek verim | GPU bölgesi | bir CPU VPS'i değil |
Çoğu kendi kendine barındıran için, Medium (6 GB) dürüst öneridir — bir 7B model artı uygulamanız ve işletim sistemi için yeterli pay. Small (4 GB), 3B'ye bağlı kalırsanız çalışır. Bunun altındaki her şey, işletim sistemi ve bağlam yiyince fazla dardır.
Neden burada yapmalısınız
Bir LLM'i kendi kendinize barındırıyorsanız, gizlilik genellikle nedenin yarısıdır — bu yüzden kutuyu kiralamak için kimliğinizi teslim etmeniz garip olurdu. Buna mecbur değilsiniz: USDC veya USDT ile (ya da giriş kanalı üzerinden bir kartla) ödeyebilirsiniz, KYC yok ve sunucu yaklaşık bir dakikada sizindir. Kripto-yerel, ajan-dostu ve veri kontrol ettiğiniz bir makinede kalır.
Takas, dürüst olduğumuz olandır: yalnızca CPU, 6 GB tavan, küçük modeller. Bunun içinde, kendi kendine barındırmak harikadır. Dışında, bir GPU gerektiren bir iş için kimsenin size bir CPU kutusu satmasına izin vermeyin.
Denemeye hazır mısınız? Bir plan seçin, ödeyin ve yaklaşık 60 saniyede root'a sahip olursunuz — sonra kendi özel modelinize üç komut.
Yorumlar
Henüz yorum yok. İlk olun.