Yaz sıcağı — her şey eriyor, fiyatlarımız bile.−25%31 Ağustos'a kadar her yıllık planda −%25Planları gör
EQVPS
Hemen başla

Ollama ve Yerel LLM'ler için VPS

Küçük dil modellerini bir CPU sunucusunda kendiniz barındırın — gizli, sayaçsız, kripto para ile ödenir. CPU çıkarımının neyi yapıp neyi yapamadığı konusunda dürüst. $12/ay'dan başlar.

Hayal kırıklığı yaratan kısmı en baştan halledelim, çünkü internet bunu yapmayan sayfalarla dolu.

Sunucularımız yalnızca CPU'ludur. GPU sunmuyoruz. Bu, buradaki yerel LLM çalışmasının katı bir tavanı olduğu anlamına gelir ve aksini iddia etmek sadece paranızı israf eder.

CPU'da gerçekten ne çalışır

6 vCPU'ya ve 6 GB RAM'e kadar (Medium planımız — $12/ay) ile küçük nicemlenmiş modellerin aralığındasınız:

Hızlı, etkileşimli bir 70B sohbet gerekiyorsa, bir GPU barındırıcısına ihtiyacınız var — o, farklı bir sağlayıcıdan farklı bir üründür ve $12'nizi almaktansa size söylemeyi tercih ederiz.

Bir CPU kutusunun gerçekten kazandığı yer

Gizlilik. Belgeleriniz, komutlarınız, gömmeleriniz — kontrol ettiğiniz bir makineyi asla terk etmez, asla birinin eğitim verisi olmaz. Birçok kişi için bütün mesele budur ve saniyede birkaç token kabul edilebilir bir takastır.

Maliyet öngörülebilirliği. Token başına fatura yok. Elli bin kaydı sınıflandıran bir hat, elliyi sınıflandıranla aynıya mal olur: $12.

Eşzamansız çalışma. En faydalı LLM çalışması bir sohbet penceresi değildir. Bir kuyruktur: bunları özetle, şunları etiketle, bu külliyatı göm. Gece boyu bir birikimi çiğneyen bir CPU kutusu bunda gayet iyidir.

Kurulum

# Ubuntu 24.04 — Medium planı önerilir
curl -fsSL https://ollama.com/install.sh | sh

# Küçük bir şeyle başlayın ve kendiniz görün
ollama pull llama3.2:3b
ollama run llama3.2:3b "Summarize this in one sentence: ..."

# Gömmeler — CPU için tam kıvamı
ollama pull nomic-embed-text
curl http://localhost:11434/api/embeddings \
  -d '{"model":"nomic-embed-text","prompt":"hello world"}'

Ollama, localhost:11434 üzerinde bir HTTP API sunar. Orada tutun. Başka bir yerden erişmeniz gerekiyorsa, bir özel IP planında kimlik doğrulamalı bir ters proxy arkasına koyun — kimlik doğrulamasız bir model uç noktasını asla açık internete açmayın.

Bir vektör veritabanıyla eşleştirin (Docker'da Qdrant veya pgvector) ve tek bir $12'lik kutuda tam bir gizli RAG yığınına sahip olursunuz. Bu kombinasyon — küçük yerel gömmeler, yerel vektör deposu, ağır üretim adımı için yalnızca harici API — bunun gibi donanımda gerçekten mantıklı olan kurulumdur.

Plan seçimi

KullanımPlanFiyat
Gömmeler, 1–3B modeller, RAG hattıMedium$12/ay
Aynısı, artı kimlik doğrulama arkasında herkese açık bir uç noktaMedium-IP$20/ay
Sadece küçük modelleri test etmekSmall$8/ay

Yalnızca CPU, 6 vCPU'ya ve 6 GB RAM'e kadar. NVMe depolama, sayaçsız trafik, Almanya veya Finlandiya. Kripto para ödemesi, KYC yok. Yıllık faturalandırma, on iki yerine tek transferdir.

İlgili okuma


Hazır mısınız? Bir sunucu dağıt → — yaklaşık bir dakikada canlı, kripto ile ödenir, kimlik gerekmez.

Dağıtmaya hazır mısınız? Kripto ile ödeyin, KYC yok — yaklaşık bir dakikada çevrimiçi.

Dağıt →

SSS

Bunun üzerinde Llama 70B çalıştırabilir miyim?

Hayır. Planlarımız yalnızca CPU'ludur ve 6 GB'ye kadar RAM'e sahiptir — bu, küçük nicemlenmiş modellerin aralığıdır (kabaca 4 bitte 1B–8B). 70B'lik bir model bir GPU ve çok daha fazla bellek ister. GPU sunmuyoruz ve size bir hayal kırıklığı satmaktansa bunu söylemeyi tercih ederiz.

CPU çıkarımı gerçekte ne kadar hızlı?

4 bit nicemlemede 7–8B'lik bir modelde saniyede birkaç token, 1–3B modellerde belirgin biçimde daha iyi bekleyin. Bu; arka plan işleri, gömmeler, sınıflandırma ve eşzamansız hatlar için iyidir. Hızlı, etkileşimli bir sohbet için iyi değildir.

Peki bu aslında ne için iyi?

Gizli gömmeler, sınıflandırma, özetleme kuyrukları, gecikmenin önemli olmadığı RAG hatları ve veriyi üçüncü taraf API'lerinden uzak tutmak. Ayrıca: bir yerden GPU kiralamadan önce öğrenme, test etme ve prototipleme.

Kimlik soruyor musunuz?

Hayır. Kayıt için e-posta, ödeme için USDC veya USDT. Ki bu genelde insanların en başta gizli bir model istemesinin sebebidir.

Yorumlar

Henüz yorum yok. İlk olun.

Bir yorum bırakın

Yorumlar görünmeden önce denetlenir.