Baştan dürüst olalım: hızlı, ucuz, yüksek kaliteli üretim istiyorsanız, bir API çağırın. Bir CPU VPS'i, GPU'larla dolu bir veri merkezini yenmez ve size aksini söyleyen biri bir şey satıyordur.
Peki o zaman çıkarımı neden hiç kendiniz barındırasınız? Tek bir neden var ve iyi bir neden: sunucunuzdaki model istemlerinizi hiçbir yere göndermez.
CPU çıkarımı gerçekte neye benziyor
Yeterli RAM'le CPU üzerinde gerçek modeller çalıştırabilirsiniz. 4-bit'e kuantize edilmiş 7–8B'lik bir model çalışır. 13B çalışır. Belleğiniz varsa 30B sınıfı bir modeli bile itebilirsiniz. Yapamayacağınız şey onu hızlı yapmak — çıktı saniyede birkaç token olarak gelir, bir API'nin verdiği anlık akış değil.
Dürüst takas bu. Etkileşimli sohbet için sinir bozucu. Arka plan işi için — belgeleri gece boyunca özetlemek, bir kuyruğu sınıflandırmak, veriyi bir zamanlamaya göre zenginleştirmek — saniyede birkaç token tamamen sorunsuzdur ve kimse saate bakmıyordur.
RAM matematiği
Model, kuantize edilmiş olsun ya da olmasın bellekte oturmalı, artı bağlam ve çalışma zamanı için ek yük:
- 7–8B, 4-bit — yaklaşık 6–8 GB. Orta bir planda çalışır.
- 13B, 4-bit — kabaca 10–16 GB.
- 30B sınıfı, kuantize — kuantizasyona bağlı olarak 24–48 GB.
- Daha büyük ya da daha yüksek hassasiyet — hızla 64–80 GB'a girersiniz — ve 80 GB'ı aştığınızda tek bir Pro kutusu sığmaz, yine de CPU-yavaş.
"Yerel bir model çalıştırmanın" sessizce yüksek bellekli bir soruya dönüşmesinin nedeni budur. Model belleğin kendisidir. Aynı kutuya bir RAG indeksi veya ajanlar ekleyin, sayılar üst üste binsin.
Ollama vs vLLM, kısaca
Ollama kolay giriş kapısıdır — kur, ollama run, bitti. Modeli hazır tutmak istediğiniz özel, tek kullanıcılı bir kurulum için doğru araç odur. vLLM sunum verimi için yapılmıştır: daha fazla kurulum, eşzamanlı yük altında daha iyi, gerçekten hacim yönetiyorsanız değer. Ollama ile başlayın; gerçek trafik sunarken vLLM'e uzanın.
Gizlilik önceliği gerçekte nerede kazanır
Kendi kendine barındırılan çıkarımın gerekçesi hız ya da maliyet değil — bazı verilerin çıkamaması. Hukuki belgeler. Tıbbi kayıtlar. Sahibi belli kod. İstemi üçüncü taraf bir API'ye göndermenin politika ya da güven nedenleriyle söz konusu bile olamayacağı her şey. Tamamen kendi makinenizde çalışan yavaş bir model, gönderdiğiniz her şeyi kaydeden hızlı bir modeli yener.
Ve veri o kadar hassassa, ödemenin de muhtemelen özel olması gerekir. Kutuyu kripto parayla ve KYC olmadan kiralamak tüm zinciri — sunucu, model, istemler, faturalandırma — herhangi birinin kimlik kayıtlarından uzak tutar. Asıl teklif bu: "daha ucuz çıkarım" değil, "kimsenin göremeyeceği çıkarım."
Sonuç
Hız ve kalite için bir API kullanın — bunda utanılacak bir şey yok. Gizlilik gereksinim olduğunda ve yavaş kabul edilebilir olduğunda kendiniz barındırın. Model artı bağlamı artı kutuyu paylaşan başka her şey için boyutlandırın ve CPU'dan GPU hızı beklemeyin.
Model gerçek belleğe ihtiyaç duyduğunda, Pro serisi özel bir IP ve her gece yedeklerle 32 ile 80 GB arasında çalışır — etrafında bağlam için yer bırakarak ciddi bir kuantize modeli tutmaya yetecek kadar.
Yorumlar
Henüz yorum yok. İlk olun.