Tuondoe sehemu ya kukatisha tamaa njiani, kwa sababu intaneti imejaa kurasa zisizoifanya.
Seva zetu ni CPU-pekee. Hatutoi GPUs. Hiyo maana yake kazi ya LLM ya ndani hapa ina dari gumu, na kudhani vinginevyo kungepoteza tu pesa yako.
Kinachofanya kazi kweli kwenye CPU
Kwa hadi 6 vCPU na 6 GB ya RAM (mpango wetu wa Medium — $12/mwezi), uko katika upeo wa modeli ndogo za quantized:
- Modeli za 1B–3B (Q4): zinatumika kweli. Za kasi ya kutosha kwa classification, tagging, routing, na uchukuaji rahisi wa muundo.
- Modeli za 7B–8B (Q4): huendesha, lakini tegemea tokens chache kwa sekunde. Sawa kwa foleni inayotafuna nyaraka usiku kucha. Yenye maumivu kama dirisha la gumzo.
- Modeli za embedding: fanani bora. Ni ndogo, za kasi kwenye CPU, na hii pengine ndiyo sababu bora zaidi ya kuendesha Ollama kwenye sanduku kama yetu.
- 13B na kuendelea: usifanye. Utakuwa unafanya swapping na kusubiri.
Kama unahitaji gumzo la 70B la kasi, la interactive, unahitaji mwenyeji wa GPU — huo ni bidhaa tofauti kutoka mtoa huduma tofauti, nasi tungependa kukuambia kuliko kuchukua $12 yako.
Wapi sanduku la CPU linashinda kweli
Faragha. Nyaraka zako, prompts zako, embeddings zako — kamwe haziondoki mashine unayoidhibiti, kamwe haziwi data ya mafunzo ya mtu. Kwa watu wengi hilo ndilo lengo zima, na tokens chache kwa sekunde ni biashara inayokubalika.
Utabiri wa gharama. Hakuna bili ya per-token. Pipeline inayoainisha rekodi elfu hamsini hugharimu sawa na inayoainisha hamsini: $12.
Kazi ya async. Kazi nyingi za LLM zenye manufaa si dirisha la gumzo. Ni foleni: fanya muhtasari wa hizi, weka tag zile, embed corpus hii. Sanduku la CPU linalotafuna backlog usiku kucha ni zuri kabisa katika hilo.
Usanidi
# Ubuntu 24.04 — mpango wa Medium unapendekezwa
curl -fsSL https://ollama.com/install.sh | sh
# Anza na kitu kidogo na ujionee mwenyewe
ollama pull llama3.2:3b
ollama run llama3.2:3b "Summarize this in one sentence: ..."
# Embeddings — sehemu tamu kwa CPU
ollama pull nomic-embed-text
curl http://localhost:11434/api/embeddings \
-d '{"model":"nomic-embed-text","prompt":"hello world"}'
Ollama huhudumia HTTP API kwenye localhost:11434. Iweke pale. Kama unahitaji kuifikia kutoka mahali pengine, iweke nyuma ya reverse proxy yenye uthibitishaji kwenye mpango wa dedicated-IP — kamwe usifunue endpoint ya modeli isiyothibitishwa kwa intaneti ya wazi.
Iunge na hifadhidata ya vector (Qdrant au pgvector katika Docker) nawe una stack kamili ya RAG ya faragha kwenye sanduku moja la $12. Mchanganyiko huo — embeddings ndogo za ndani, vector store ya ndani, API ya nje tu kwa hatua nzito ya generation — ndio usanidi unaoleta maana kweli kwenye vifaa kama hivi.
Kuchagua mpango
| Matumizi | Mpango | Bei |
|---|---|---|
| Embeddings, modeli za 1–3B, pipeline ya RAG | Medium | $12/mwezi |
| Sawa, pamoja na endpoint ya umma nyuma ya auth | Medium-IP | $20/mwezi |
| Kujaribu tu modeli ndogo | Small | $8/mwezi |
CPU-pekee, hadi 6 vCPU na 6 GB RAM. Hifadhi ya NVMe, trafiki isiyopimwa, Ujerumani au Finland. Malipo ya crypto, bila KYC. Malipo ya kila mwaka ni uhamisho mmoja badala ya kumi na mbili.
Usomaji unaohusiana
- Hifadhi vector DB kwa kumbukumbu ya AI — nusu nyingine ya stack ya RAG ya faragha
- VPS kwa AI agents — uratibu kwenye sanduku lilelile
Uko tayari? Sambaza seva → — hai kwa takriban dakika moja, imelipwa kwa crypto, hakuna ID inayohitajika.
Maoni
Bado hakuna maoni. Kuwa wa kwanza.