Yaz sıcağı — her şey eriyor, fiyatlarımız bile.−25%31 Ağustos'a kadar her yıllık planda −%25Planları gör
EQVPS
Hemen başla

Bir VPS'te Ollama ile yerel bir LLM'i kendi kendinize barındırmak — gerçekte ne işe yarar

14 Haz 2026 · 3 dk okuma · EQVPS Team

Her istemi başkasının API'sine göndermek sorun değil — ta ki olana kadar. Belki veri hassastır ve sunucunuzdan hiç çıkmamasını tercih edersiniz. Belki hız sınırlarından ya da altınızda bir model sürümünün değişmesinden ya da siz denemeler yaparken tıklayan token başına bir sayaçtan bıktınız. Bir noktada "ya kendiminkini çalıştırsaydım?" bir düşünce deneyi olmaktan çıkar.

Ollama bunu gerçekten kolay kılar. Daha zor soru bir VPS'e ne sığar — ve burada dürüst cevap, abartıdan daha çok önemlidir.

CPU üzerinde gerçekte ne çalıştırabilirsiniz

GPU yok mu? O zaman CPU çıkarımı yapıyorsunuz ve model boyutu her şeydir. Kuantizasyon (ağırlıkları 4-bit'e sıkıştırmak) bunu pratik kılan şeydir — bir dilim kaliteyi kaybeder ve bir yığın bellek kurtarırsınız.

Kabaca rakamlar, önemli olanlar:

Hız, dürüstçe: birkaç vCPU'da saniyede bir avuç token görürsünüz. Yazarken okuduğunuz bir sohbet botu ya da bir kodlama asistanı için gayet iyi. Bir milyon belgeyi toplu işlemek için iyi değil — o bir GPU işidir ve aksini iddia etmiyoruz. GPU örnekleri sunmuyoruz. Planınız 70B'lik bir model ya da ağır verim gerektiriyorsa, bir CPU VPS'i — bizimki ya da başkasınınki — yanlış araçtır ve bunu bir kuruş harcamadan önce bilmelisiniz.

Ama sorularınıza yanıt veren ve asla eve telefon etmeyen özel bir 7B? Bu, 6 GB'lık bir kutuda rahatça çalışır.

Kurulum — üç komut

Sunucuyu oluşturun, SSH ile bağlanın ve:

curl -fsSL https://ollama.com/install.sh | sh   # installs Ollama
ollama run llama3.2:3b                            # pulls + runs a 3B model

Hepsi bu — terminalde sohbet ediyorsunuz. Onu kendi kodunuzdan kullanmak için, Ollama zaten 11434 portunda bir HTTP API sunar:

curl http://localhost:11434/api/generate -d '{
  "model": "llama3.2:3b",
  "prompt": "Summarize this changelog in two lines: ...",
  "stream": false
}'

Baştan bilmeye değer bir püf noktası: varsayılan olarak o API localhost'a bağlanır. Onu öyle tutun ve SSH üzerinden tünelleyin, yoksa internete açıktır. Erişilebilir olmasını istiyorsanız, onu kimlik doğrulamanın arkasına koyun — genel bir IP'de açık bir model uç noktası bırakmayın.

Kutuyu seçmek

Planı modele eşleştirin, tersini değil:

Çalıştırmak istediğinizİhtiyaç duyduğunuz RAMMantıklı plan
3B model, hafif kullanım~3 GBSmall (4 GB)
7B model, rahatça~5-6 GBMedium (6 GB)
Daha büyük / yüksek verimGPU bölgesibir CPU VPS'i değil

Çoğu kendi kendine barındıran için, Medium (6 GB) dürüst öneridir — bir 7B model artı uygulamanız ve işletim sistemi için yeterli pay. Small (4 GB), 3B'ye bağlı kalırsanız çalışır. Bunun altındaki her şey, işletim sistemi ve bağlam yiyince fazla dardır.

Neden burada yapmalısınız

Bir LLM'i kendi kendinize barındırıyorsanız, gizlilik genellikle nedenin yarısıdır — bu yüzden kutuyu kiralamak için kimliğinizi teslim etmeniz garip olurdu. Buna mecbur değilsiniz: USDC veya USDT ile (ya da giriş kanalı üzerinden bir kartla) ödeyebilirsiniz, KYC yok ve sunucu yaklaşık bir dakikada sizindir. Kripto-yerel, ajan-dostu ve veri kontrol ettiğiniz bir makinede kalır.

Takas, dürüst olduğumuz olandır: yalnızca CPU, 6 GB tavan, küçük modeller. Bunun içinde, kendi kendine barındırmak harikadır. Dışında, bir GPU gerektiren bir iş için kimsenin size bir CPU kutusu satmasına izin vermeyin.

Denemeye hazır mısınız? Bir plan seçin, ödeyin ve yaklaşık 60 saniyede root'a sahip olursunuz — sonra kendi özel modelinize üç komut.

SSS

GPU olmadan bir LLM çalıştırabilir miyim?

Evet, küçük modeller için. 4-bit kuantizasyonlu bir 3B ya da 7B model CPU üzerinde çalışır ve okunabilir bir hızda yanıt verir — bir sohbet botu, bir kodlama yardımcısı ya da imleci izlemediğiniz arka plan görevleri için iyi. CPU üzerinde yapamayacağınız şey büyük bir modeli (13B ve üzeri) sunmak ya da yüksek verim itmektir; işte orada bir GPU isteğe bağlı olmaktan çıkar.

Llama 7B için ne kadar RAM'e ihtiyacım var?

Bağlam penceresini ve işletim sistemini eklediğinizde 4-bit bir 7B model için yaklaşık 5 GB — yani 6 GB'lık bir kutu rahat tabandır. Bir 3B model yaklaşık 3 GB'a sığar. Daha küçük kuant (Q4) biraz kaliteyi çok daha az bellek için takas eder, ki bu bir VPS'te doğru takastır.

Bir LLM'i kendi kendine barındırmak bir API'den ucuz mu?

Hacme bağlı. Barındırılan bir API token başına ücret alır ve boştayken hiçbir şeye mal olmaz; bir VPS ise kullanın ya da kullanmayın düz aylık bir faturadır. Sürekli bir istek akışı çalıştırıyorsanız ya da esas olarak gizliliği ve hız sınırı olmamasını önemsiyorsanız, kendi kendine barındırmak kazanır. Ara sıra tek seferlik istemler için, sayaçlı bir API daha ucuzdur.

Bir bulut API'si kullanmak yerine neden kendiniz barındırasınız?

İnsanların bunu gerçekten yapmasının üç nedeni: veri sunucunuzdan asla çıkmaz (hukuki, tıbbi ya da sadece özel notlar için gerçek), hız sınırı ya da token başına sayaç yoktur ve model altınızdan değişmez ya da kullanımdan kaldırılmaz. Bedeli, kutunun bakımını yapmanız ve donanımının içinde yaşamanızdır.

Bir CPU VPS'inde gerçekçi olarak çalıştırabileceğim en büyük model nedir?

6 GB'lık bir kutuda 4-bit bir 7B model ideal noktadır. Yeterli RAM'le teknik olarak bir 13B yükleyebilirsiniz, ama CPU üzerinde hissedecek kadar yavaşlar. Ondan sonra bir GPU istersiniz, ki bu farklı türde bir sunucudur.

← Blog'a dönPlanları ve fiyatları gör →

Yorumlar

Henüz yorum yok. İlk olun.

Bir yorum bırakın

Yorumlar görünmeden önce denetlenir.