Hayal kırıklığı yaratan kısmı en baştan halledelim, çünkü internet bunu yapmayan sayfalarla dolu.
Sunucularımız yalnızca CPU'ludur. GPU sunmuyoruz. Bu, buradaki yerel LLM çalışmasının katı bir tavanı olduğu anlamına gelir ve aksini iddia etmek sadece paranızı israf eder.
CPU'da gerçekten ne çalışır
6 vCPU'ya ve 6 GB RAM'e kadar (Medium planımız — $12/ay) ile küçük nicemlenmiş modellerin aralığındasınız:
- 1B–3B modeller (Q4): gerçekten kullanılabilir. Sınıflandırma, etiketleme, yönlendirme ve basit yapılandırılmış çıkarım için yeterince hızlı.
- 7B–8B modeller (Q4): çalışır, ama saniyede birkaç token bekleyin. Belgeleri gece boyu çiğneyen bir kuyruk için iyi. Sohbet penceresi olarak acı verici.
- Gömme modelleri: mükemmel uyum. Küçüktürler, CPU'da hızlıdırlar ve bu muhtemelen bizimki gibi bir kutuda Ollama çalıştırmanın tek en iyi sebebidir.
- 13B ve üstü: yapmayın. Swap'lersiniz ve beklersiniz.
Hızlı, etkileşimli bir 70B sohbet gerekiyorsa, bir GPU barındırıcısına ihtiyacınız var — o, farklı bir sağlayıcıdan farklı bir üründür ve $12'nizi almaktansa size söylemeyi tercih ederiz.
Bir CPU kutusunun gerçekten kazandığı yer
Gizlilik. Belgeleriniz, komutlarınız, gömmeleriniz — kontrol ettiğiniz bir makineyi asla terk etmez, asla birinin eğitim verisi olmaz. Birçok kişi için bütün mesele budur ve saniyede birkaç token kabul edilebilir bir takastır.
Maliyet öngörülebilirliği. Token başına fatura yok. Elli bin kaydı sınıflandıran bir hat, elliyi sınıflandıranla aynıya mal olur: $12.
Eşzamansız çalışma. En faydalı LLM çalışması bir sohbet penceresi değildir. Bir kuyruktur: bunları özetle, şunları etiketle, bu külliyatı göm. Gece boyu bir birikimi çiğneyen bir CPU kutusu bunda gayet iyidir.
Kurulum
# Ubuntu 24.04 — Medium planı önerilir
curl -fsSL https://ollama.com/install.sh | sh
# Küçük bir şeyle başlayın ve kendiniz görün
ollama pull llama3.2:3b
ollama run llama3.2:3b "Summarize this in one sentence: ..."
# Gömmeler — CPU için tam kıvamı
ollama pull nomic-embed-text
curl http://localhost:11434/api/embeddings \
-d '{"model":"nomic-embed-text","prompt":"hello world"}'
Ollama, localhost:11434 üzerinde bir HTTP API sunar. Orada tutun. Başka bir yerden erişmeniz gerekiyorsa, bir özel IP planında kimlik doğrulamalı bir ters proxy arkasına koyun — kimlik doğrulamasız bir model uç noktasını asla açık internete açmayın.
Bir vektör veritabanıyla eşleştirin (Docker'da Qdrant veya pgvector) ve tek bir $12'lik kutuda tam bir gizli RAG yığınına sahip olursunuz. Bu kombinasyon — küçük yerel gömmeler, yerel vektör deposu, ağır üretim adımı için yalnızca harici API — bunun gibi donanımda gerçekten mantıklı olan kurulumdur.
Plan seçimi
| Kullanım | Plan | Fiyat |
|---|---|---|
| Gömmeler, 1–3B modeller, RAG hattı | Medium | $12/ay |
| Aynısı, artı kimlik doğrulama arkasında herkese açık bir uç nokta | Medium-IP | $20/ay |
| Sadece küçük modelleri test etmek | Small | $8/ay |
Yalnızca CPU, 6 vCPU'ya ve 6 GB RAM'e kadar. NVMe depolama, sayaçsız trafik, Almanya veya Finlandiya. Kripto para ödemesi, KYC yok. Yıllık faturalandırma, on iki yerine tek transferdir.
İlgili okuma
- Yapay zeka belleği için bir vektör DB barındırın — gizli bir RAG yığınının diğer yarısı
- Yapay zeka ajanları için VPS — aynı kutuda orkestrasyon
Hazır mısınız? Bir sunucu dağıt → — yaklaşık bir dakikada canlı, kripto ile ödenir, kimlik gerekmez.
Yorumlar
Henüz yorum yok. İlk olun.