EQVPS
Anza

Kujihifadhi local LLM kwenye VPS na Ollama — kile kinachofanya kazi kweli

Jun 14, 2026 · 3 min read · EQVPS Team

Kutuma kila prompt kwa API ya mtu mwingine ni sawa — hadi si. Labda data ni nyeti nawe ungependa isitoke kamwe seva yako. Labda umechoka na rate limits, au na version ya modeli ikibadilika chini ya miguu yako, au na per-token meter ikitictic unapotest. Kwa mahali fulani "vipi kama ningeendesha yangu tu?" inaacha kuwa jaribio la fikra.

Ollama huifanya hilo rahisi dhati. Swali gumu zaidi ni kinachofaa kwenye VPS — na hapa jibu la uaminifu linahusika zaidi ya hype.

Kile unachoweza kuendesha kweli kwenye CPU

Hakuna GPU? Basi unafanya CPU inference, na saizi ya modeli ni kila kitu. Quantization (kubana weights hadi 4-bit) ndicho kinachoifanya hii kuwa ya vitendo — unapoteza kipande cha ubora na kuokoa rundo la kumbukumbu.

Namba za jumla, zile zinazohusika:

Kasi, kwa uaminifu: kwenye vCPUs chache utaona mkono wa tokens kwa sekunde. Sawa kabisa kwa chatbot au coding assistant ambapo unasoma inavyoandika. Si sawa kwa batch-processing ya nyaraka milioni — hiyo ni kazi ya GPU, nasi hatudhani vinginevyo. Hatutoi GPU instances. Kama mpango wako unahitaji modeli ya 70B au throughput nzito, CPU VPS — yetu au ya mtu yeyote — ni zana isiyofaa, nawe unapaswa kujua hilo kabla ya kutumia senti.

Lakini 7B ya faragha inayojibu maswali yako na kamwe haipigii nyumbani? Hiyo inaendesha kwa starehe kwenye sanduku la 6 GB.

Install — amri tatu

Anzisha seva, SSH ndani, na:

curl -fsSL https://ollama.com/install.sh | sh   # husakinisha Ollama
ollama run llama3.2:3b                            # huvuta + kuendesha modeli ya 3B

Ndio hivyo — unachat katika terminal. Kuitumia kutoka code yako, Ollama tayari husrv HTTP API kwenye port 11434:

curl http://localhost:11434/api/generate -d '{
  "model": "llama3.2:3b",
  "prompt": "Summarize this changelog in two lines: ...",
  "stream": false
}'

Gotcha moja inayostahili kujua mapema: kwa chaguo-msingi API hiyo hufunga kwa localhost. Iweke hivyo na tunnel kupitia SSH, au imefunuliwa kwa intaneti. Kama unataka ifikike, iweke nyuma ya auth — usiache model endpoint iliyo wazi kwenye public IP.

Kuchagua sanduku

Linganisha mpango na modeli, si kinyume:

Unataka kuendeshaRAM unayohitajiMpango wa busara
Modeli ya 3B, matumizi mepesi~3 GBSmall (4 GB)
Modeli ya 7B, kwa starehe~5-6 GBMedium (6 GB)
Kubwa zaidi / throughput ya juueneo la GPUsi CPU VPS

Kwa self-hosters wengi, Medium (6 GB) ndiyo pendekezo la uaminifu — nafasi ya kutosha kwa modeli ya 7B plus app yako na OS. Small (4 GB) inafanya kazi kama unabaki na 3B. Chochote chini ya hapo ni finyu mno mara OS na context vinapoingia.

Kwa nini kuifanya hapa

Kama unajihifadhi LLM, faragha kwa kawaida ni nusu ya sababu — hivyo ingekuwa ajabu kutoa ID yako kukodisha sanduku. Huhitaji: unaweza kulipa kwa USDC au USDT (au kadi kupitia on-ramp), bila KYC, na seva ni yako kwa takriban dakika moja. Crypto-native, agent-rafiki, na data inabaki kwenye mashine unayoidhibiti.

Biashara ni ile tuliyokuwa waaminifu juu yake: CPU tu, dari ya 6 GB, modeli ndogo. Ndani ya hiyo, kujihifadhi ni zuri. Nje yake, usiruhusu yeyote akuuzie sanduku la CPU kwa kazi inayohitaji GPU.

Uko tayari kujaribu? Chagua mpango, lipa, nawe utakuwa na root kwa takriban sekunde 60 — kisha ni amri tatu hadi modeli yako ya faragha.

FAQ

Je naweza kuendesha LLM bila GPU?

Ndiyo, kwa modeli ndogo. Modeli ya 3B au 7B katika 4-bit quantization inaendesha kwenye CPU na kujibu kwa kasi ya kusomeka — sawa kwa chatbot, coding helper, au kazi za nyuma ambapo huangalii cursor. Kile usichoweza kufanya kwenye CPU ni kusrv modeli kubwa (13B na kuendelea) au kusukuma throughput ya juu; hapo ndipo GPU inaacha kuwa ya hiari.

Ninahitaji RAM kiasi gani kwa Llama 7B?

Karibu 5 GB kwa modeli ya 4-bit 7B mara unapoongeza context window na OS — hivyo sanduku la 6 GB ni sakafu ya starehe. Modeli ya 3B inafaa katika takriban 3 GB. Quant ndogo (Q4) hubadilisha ubora kidogo kwa kumbukumbu kidogo zaidi, ambako ndiyo biashara sahihi kwenye VPS.

Je kujihifadhi LLM ni nafuu kuliko API?

Inategemea wingi. Hosted API hutoza per token na hugharimu chochote ikiwa idle; VPS ni bili tambarare ya kila mwezi iwe unaitumia au la. Kama unaendesha mkondo thabiti wa requests, au unajali zaidi faragha na hakuna rate limits, kujihifadhi kunashinda. Kwa prompts za one-off za mara kwa mara, metered API ni nafuu.

Kwa nini kujihifadhi badala ya kutumia cloud API?

Sababu tatu watu hufanya hivi: data kamwe haitoki seva yako (halisi kwa kisheria, kitabibu, au tu notes za faragha), hakuna rate limits au per-token meter, na modeli haitabadilika au kuwa deprecated chini yako. Gharama ni kwamba wewe unasimamia sanduku na kuishi ndani ya vifaa vyake.

Modeli kubwa zaidi naweza kuendesha kwa hakika kwenye CPU VPS ni ipi?

Modeli ya 7B katika 4-bit ndiyo sehemu tamu kwenye sanduku la 6 GB. Unaweza kiufundi kupakia 13B na RAM ya kutosha, lakini kwenye CPU inakuwa polepole ya kutosha kwamba utaihisi. Zaidi ya hapo unataka GPU, ambayo ni aina tofauti ya host.

← Back to blogSee plans & pricing →

Maoni

Bado hakuna maoni. Kuwa wa kwanza.

Acha maoni

Maoni yanakaguliwa kabla ya kuonekana.