Kutuma kila prompt kwa API ya mtu mwingine ni sawa — hadi si. Labda data ni nyeti nawe ungependa isitoke kamwe seva yako. Labda umechoka na rate limits, au na version ya modeli ikibadilika chini ya miguu yako, au na per-token meter ikitictic unapotest. Kwa mahali fulani "vipi kama ningeendesha yangu tu?" inaacha kuwa jaribio la fikra.
Ollama huifanya hilo rahisi dhati. Swali gumu zaidi ni kinachofaa kwenye VPS — na hapa jibu la uaminifu linahusika zaidi ya hype.
Kile unachoweza kuendesha kweli kwenye CPU
Hakuna GPU? Basi unafanya CPU inference, na saizi ya modeli ni kila kitu. Quantization (kubana weights hadi 4-bit) ndicho kinachoifanya hii kuwa ya vitendo — unapoteza kipande cha ubora na kuokoa rundo la kumbukumbu.
Namba za jumla, zile zinazohusika:
- Modeli ya 3B, 4-bit — ~3 GB RAM. Chapchap ya kutosha kwa chat na kazi rahisi.
- Modeli ya 7B, 4-bit — ~5 GB RAM. Sehemu tamu: yenye akili zaidi kwa maana, bado inaendesha kwa kasi ya kusomeka.
- 13B na kuendelea — 8-10 GB+ na polepole kwenye CPU. Kiufundi inawezekana, kivitendo ya kusumbua.
Kasi, kwa uaminifu: kwenye vCPUs chache utaona mkono wa tokens kwa sekunde. Sawa kabisa kwa chatbot au coding assistant ambapo unasoma inavyoandika. Si sawa kwa batch-processing ya nyaraka milioni — hiyo ni kazi ya GPU, nasi hatudhani vinginevyo. Hatutoi GPU instances. Kama mpango wako unahitaji modeli ya 70B au throughput nzito, CPU VPS — yetu au ya mtu yeyote — ni zana isiyofaa, nawe unapaswa kujua hilo kabla ya kutumia senti.
Lakini 7B ya faragha inayojibu maswali yako na kamwe haipigii nyumbani? Hiyo inaendesha kwa starehe kwenye sanduku la 6 GB.
Install — amri tatu
Anzisha seva, SSH ndani, na:
curl -fsSL https://ollama.com/install.sh | sh # husakinisha Ollama
ollama run llama3.2:3b # huvuta + kuendesha modeli ya 3B
Ndio hivyo — unachat katika terminal. Kuitumia kutoka code yako, Ollama tayari husrv HTTP API kwenye port 11434:
curl http://localhost:11434/api/generate -d '{
"model": "llama3.2:3b",
"prompt": "Summarize this changelog in two lines: ...",
"stream": false
}'
Gotcha moja inayostahili kujua mapema: kwa chaguo-msingi API hiyo hufunga kwa localhost. Iweke hivyo na tunnel kupitia SSH, au imefunuliwa kwa intaneti. Kama unataka ifikike, iweke nyuma ya auth — usiache model endpoint iliyo wazi kwenye public IP.
Kuchagua sanduku
Linganisha mpango na modeli, si kinyume:
| Unataka kuendesha | RAM unayohitaji | Mpango wa busara |
|---|---|---|
| Modeli ya 3B, matumizi mepesi | ~3 GB | Small (4 GB) |
| Modeli ya 7B, kwa starehe | ~5-6 GB | Medium (6 GB) |
| Kubwa zaidi / throughput ya juu | eneo la GPU | si CPU VPS |
Kwa self-hosters wengi, Medium (6 GB) ndiyo pendekezo la uaminifu — nafasi ya kutosha kwa modeli ya 7B plus app yako na OS. Small (4 GB) inafanya kazi kama unabaki na 3B. Chochote chini ya hapo ni finyu mno mara OS na context vinapoingia.
Kwa nini kuifanya hapa
Kama unajihifadhi LLM, faragha kwa kawaida ni nusu ya sababu — hivyo ingekuwa ajabu kutoa ID yako kukodisha sanduku. Huhitaji: unaweza kulipa kwa USDC au USDT (au kadi kupitia on-ramp), bila KYC, na seva ni yako kwa takriban dakika moja. Crypto-native, agent-rafiki, na data inabaki kwenye mashine unayoidhibiti.
Biashara ni ile tuliyokuwa waaminifu juu yake: CPU tu, dari ya 6 GB, modeli ndogo. Ndani ya hiyo, kujihifadhi ni zuri. Nje yake, usiruhusu yeyote akuuzie sanduku la CPU kwa kazi inayohitaji GPU.
Uko tayari kujaribu? Chagua mpango, lipa, nawe utakuwa na root kwa takriban sekunde 60 — kisha ni amri tatu hadi modeli yako ya faragha.
Maoni
Bado hakuna maoni. Kuwa wa kwanza.