Ollama yerel bir modeli çalıştırmayı tek satırlık bir kuruluma dönüştürür. Bu, nasıl-yapılır rehberidir; CPU çıkarımının neyi yapıp neyi yapamayacağının dürüst tablosu (ve RAG'in tatlı noktası) için Ollama için VPS kullanım senaryosuna ve Ollama'yı kendin barındırmaya bak.
1. Ollama'yı kur
curl -fsSL https://ollama.com/install.sh | sh
Bu, Ollama'yı kurar ve localhost:11434'te dinleyen bir systemd hizmeti olarak başlatır.
2. Küçük bir model çek ve çalıştır
Bir CPU makinesinde küçük başla:
ollama pull llama3.2:3b
ollama run llama3.2:3b "Summarize this in one sentence: ..."
3B modeller CPU'da gerçekten kullanılabilir; 7–8B saniyede birkaç token'la çalışır (batch için iyi, sohbet için eziyet); 13B+ takas eder ve sürünür — yapma.
3. HTTP API'yi çağır
curl http://localhost:11434/api/generate \
-d '{"model":"llama3.2:3b","prompt":"ping","stream":false}'
Gömülemeler CPU'nun tatlı noktasıdır:
ollama pull nomic-embed-text
curl http://localhost:11434/api/embeddings \
-d '{"model":"nomic-embed-text","prompt":"hello world"}'
4. localhost'ta tut — gerekirse güvenle aç
Ollama varsayılan olarak 127.0.0.1:11434'e bağlanır. Orada bırak. Başka bir makineden erişmen gerekirse, önüne bir ayrılmış IP planında kimlik doğrulamalı bir ters proxy koy (nginx + HTTPS rehberi) ya da bir SSH tüneli kullan — kimlik doğrulamasız bir model uç noktasını asla herkese açık şekilde açma.
Dürüst kısım
Bunlar yalnızca CPU örnekleridir (GPU yok). Küçük nicemlenmiş modeller ve gömülemeler iyi çalışır; büyükler çalışmaz. Ollama'yı özel bir RAG yığını için bir vektör veritabanıyla eşle — küçük yerel gömülemeler artı yerel bir vektör deposu, burada gerçekten parlayan kurulumdur. Medium (aylık 12$, 6 GB) rahat plandır. Yaklaşık bir dakikada root, KYC yok, kripto ile ödeme.
Yorumlar
Henüz yorum yok. İlk olun.