EQVPS
Mulai

Cara memasang Ollama di VPS (dan memanggil API-nya)

Pasang Ollama di VPS, tarik model kecil, dan panggil API HTTP-nya — dengan catatan jujur bahwa ini mesin CPU, jadi tetaplah pada model terkuantisasi kecil dan embedding. Perintah salin-tempel, dan cara mengeksposnya dengan aman.

Ollama menjadikan menjalankan model lokal sebagai pemasangan satu baris. Ini panduannya; untuk gambaran jujur tentang apa yang bisa dan tidak bisa dilakukan inferensi CPU (dan titik manis RAG), lihat studi kasus VPS untuk Ollama dan swakelola Ollama.

1. Pasang Ollama

curl -fsSL https://ollama.com/install.sh | sh

Itu memasang Ollama dan menjalankannya sebagai layanan systemd yang mendengarkan di localhost:11434.

2. Tarik dan jalankan model kecil

Di mesin CPU, mulai dari kecil:

ollama pull llama3.2:3b
ollama run llama3.2:3b "Summarize this in one sentence: ..."

Model 3B benar-benar dapat dipakai di CPU; 7–8B berjalan pada beberapa token/detik (oke untuk batch, menyiksa untuk chat); 13B+ akan swap dan merangkak — jangan.

3. Panggil API HTTP

curl http://localhost:11434/api/generate \
  -d '{"model":"llama3.2:3b","prompt":"ping","stream":false}'

Embedding adalah titik manis CPU:

ollama pull nomic-embed-text
curl http://localhost:11434/api/embeddings \
  -d '{"model":"nomic-embed-text","prompt":"hello world"}'

4. Biarkan di localhost — ekspos dengan aman jika perlu

Ollama mengikat ke 127.0.0.1:11434 secara bawaan. Biarkan di sana. Jika Anda perlu menjangkaunya dari mesin lain, taruh reverse proxy dengan autentikasi di depannya pada paket IP khusus (panduan nginx + HTTPS) atau gunakan terowongan SSH — jangan pernah mengekspos endpoint model tanpa autentikasi secara publik.

Bagian jujurnya

Ini instance khusus CPU (tanpa GPU). Model terkuantisasi kecil dan embedding berjalan baik; model besar tidak. Pasangkan Ollama dengan basis data vektor untuk tumpukan RAG privat — embedding lokal kecil plus penyimpanan vektor lokal adalah penyiapan yang benar-benar bersinar di sini. Medium ($12/bln, 6 GB) adalah paket yang nyaman. Root dalam sekitar semenit, tanpa KYC, bayar dengan kripto.

FAQ

Bagaimana memasang Ollama di VPS?

Satu perintah: curl -fsSL https://ollama.com/install.sh | sh. Lalu ollama pull model kecil dan ollama run, atau panggil API HTTP di localhost:11434. Langkahnya di bawah. Di VPS CPU tetaplah pada model terkuantisasi kecil (1B–8B) dan embedding — model besar butuh GPU.

Apakah model akan cepat di VPS CPU?

Yang kecil ya, yang besar tidak. Harapkan beberapa token per detik pada model 7–8B dengan kuantisasi 4-bit, dan performa yang benar-benar gesit pada model 1–3B dan model embedding. Bagus untuk job latar, klasifikasi, dan pipeline RAG — bukan untuk chat interaktif cepat pada model besar.

Haruskah saya mengekspos API Ollama ke internet?

Tidak. Biarkan di localhost:11434. Jika butuh akses jarak jauh, taruh di belakang reverse proxy dengan autentikasi pada paket IP khusus, atau jangkau lewat terowongan SSH. Jangan pernah mengekspos endpoint model tanpa autentikasi ke internet terbuka.

Paket apa yang saya butuhkan?

Medium kami ($12/bln, 6 GB) cocok nyaman untuk model kecil dan embedding; Small ($8) bisa untuk menguji model 1–3B. Ini instance khusus CPU — tanpa GPU — jadi ukur berdasarkan jejak RAM model, bukan berharap kecepatan.

Apakah Anda meminta identitas atau kartu?

Tidak. Email untuk mendaftar, bayar dengan USDC atau USDT — tanpa dokumen, tanpa kartu.

Komentar

Belum ada komentar. Jadilah yang pertama.

Tinggalkan komentar

Komentar dimoderasi sebelum muncul.