Ollama menjadikan menjalankan model lokal sebagai pemasangan satu baris. Ini panduannya; untuk gambaran jujur tentang apa yang bisa dan tidak bisa dilakukan inferensi CPU (dan titik manis RAG), lihat studi kasus VPS untuk Ollama dan swakelola Ollama.
1. Pasang Ollama
curl -fsSL https://ollama.com/install.sh | sh
Itu memasang Ollama dan menjalankannya sebagai layanan systemd yang mendengarkan di localhost:11434.
2. Tarik dan jalankan model kecil
Di mesin CPU, mulai dari kecil:
ollama pull llama3.2:3b
ollama run llama3.2:3b "Summarize this in one sentence: ..."
Model 3B benar-benar dapat dipakai di CPU; 7–8B berjalan pada beberapa token/detik (oke untuk batch, menyiksa untuk chat); 13B+ akan swap dan merangkak — jangan.
3. Panggil API HTTP
curl http://localhost:11434/api/generate \
-d '{"model":"llama3.2:3b","prompt":"ping","stream":false}'
Embedding adalah titik manis CPU:
ollama pull nomic-embed-text
curl http://localhost:11434/api/embeddings \
-d '{"model":"nomic-embed-text","prompt":"hello world"}'
4. Biarkan di localhost — ekspos dengan aman jika perlu
Ollama mengikat ke 127.0.0.1:11434 secara bawaan. Biarkan di sana. Jika Anda perlu menjangkaunya dari mesin lain, taruh reverse proxy dengan autentikasi di depannya pada paket IP khusus (panduan nginx + HTTPS) atau gunakan terowongan SSH — jangan pernah mengekspos endpoint model tanpa autentikasi secara publik.
Bagian jujurnya
Ini instance khusus CPU (tanpa GPU). Model terkuantisasi kecil dan embedding berjalan baik; model besar tidak. Pasangkan Ollama dengan basis data vektor untuk tumpukan RAG privat — embedding lokal kecil plus penyimpanan vektor lokal adalah penyiapan yang benar-benar bersinar di sini. Medium ($12/bln, 6 GB) adalah paket yang nyaman. Root dalam sekitar semenit, tanpa KYC, bayar dengan kripto.
Komentar
Belum ada komentar. Jadilah yang pertama.