EQVPS
Anza

VPS kwa Ollama na LLMs za Ndani

Jihifadhi modeli ndogo za lugha kwenye seva ya CPU — ya faragha, isiyopimwa, imelipwa kwa crypto. Ya uaminifu kuhusu kile CPU inference inaloweza na lisiloweza kufanya. Kuanzia $12/mwezi.

Tuondoe sehemu ya kukatisha tamaa njiani, kwa sababu intaneti imejaa kurasa zisizoifanya.

Seva zetu ni CPU-pekee. Hatutoi GPUs. Hiyo maana yake kazi ya LLM ya ndani hapa ina dari gumu, na kudhani vinginevyo kungepoteza tu pesa yako.

Kinachofanya kazi kweli kwenye CPU

Kwa hadi 6 vCPU na 6 GB ya RAM (mpango wetu wa Medium — $12/mwezi), uko katika upeo wa modeli ndogo za quantized:

Kama unahitaji gumzo la 70B la kasi, la interactive, unahitaji mwenyeji wa GPU — huo ni bidhaa tofauti kutoka mtoa huduma tofauti, nasi tungependa kukuambia kuliko kuchukua $12 yako.

Wapi sanduku la CPU linashinda kweli

Faragha. Nyaraka zako, prompts zako, embeddings zako — kamwe haziondoki mashine unayoidhibiti, kamwe haziwi data ya mafunzo ya mtu. Kwa watu wengi hilo ndilo lengo zima, na tokens chache kwa sekunde ni biashara inayokubalika.

Utabiri wa gharama. Hakuna bili ya per-token. Pipeline inayoainisha rekodi elfu hamsini hugharimu sawa na inayoainisha hamsini: $12.

Kazi ya async. Kazi nyingi za LLM zenye manufaa si dirisha la gumzo. Ni foleni: fanya muhtasari wa hizi, weka tag zile, embed corpus hii. Sanduku la CPU linalotafuna backlog usiku kucha ni zuri kabisa katika hilo.

Usanidi

# Ubuntu 24.04 — mpango wa Medium unapendekezwa
curl -fsSL https://ollama.com/install.sh | sh

# Anza na kitu kidogo na ujionee mwenyewe
ollama pull llama3.2:3b
ollama run llama3.2:3b "Summarize this in one sentence: ..."

# Embeddings — sehemu tamu kwa CPU
ollama pull nomic-embed-text
curl http://localhost:11434/api/embeddings \
  -d '{"model":"nomic-embed-text","prompt":"hello world"}'

Ollama huhudumia HTTP API kwenye localhost:11434. Iweke pale. Kama unahitaji kuifikia kutoka mahali pengine, iweke nyuma ya reverse proxy yenye uthibitishaji kwenye mpango wa dedicated-IP — kamwe usifunue endpoint ya modeli isiyothibitishwa kwa intaneti ya wazi.

Iunge na hifadhidata ya vector (Qdrant au pgvector katika Docker) nawe una stack kamili ya RAG ya faragha kwenye sanduku moja la $12. Mchanganyiko huo — embeddings ndogo za ndani, vector store ya ndani, API ya nje tu kwa hatua nzito ya generation — ndio usanidi unaoleta maana kweli kwenye vifaa kama hivi.

Kuchagua mpango

MatumiziMpangoBei
Embeddings, modeli za 1–3B, pipeline ya RAGMedium$12/mwezi
Sawa, pamoja na endpoint ya umma nyuma ya authMedium-IP$20/mwezi
Kujaribu tu modeli ndogoSmall$8/mwezi

CPU-pekee, hadi 6 vCPU na 6 GB RAM. Hifadhi ya NVMe, trafiki isiyopimwa, Ujerumani au Finland. Malipo ya crypto, bila KYC. Malipo ya kila mwaka ni uhamisho mmoja badala ya kumi na mbili.

Usomaji unaohusiana


Uko tayari? Sambaza seva → — hai kwa takriban dakika moja, imelipwa kwa crypto, hakuna ID inayohitajika.

Uko tayari kusambaza? Lipa kwa crypto, bila KYC — hai kwa takriban dakika moja.

Sambaza sasa →

Maswali

Je naweza kuendesha Llama 70B juu ya hii?

Hapana. Mipango yetu ni CPU-pekee yenye hadi 6 GB ya RAM — huo ni upeo wa modeli ndogo za quantized (takriban 1B–8B kwa 4-bit). Modeli ya 70B inahitaji GPU na kumbukumbu nyingi zaidi. Hatutoi GPUs, nasi tungependa kusema hivyo badala ya kukuuzia kukatishwa tamaa.

CPU inference ni ya kasi kiasi gani, kweli?

Tegemea tokens chache kwa sekunde kwenye modeli ya 7–8B kwa 4-bit quantization, na bora zaidi kwa maana kwenye modeli za 1–3B. Hiyo ni sawa kwa kazi za nyuma, embeddings, classification, na pipelines za async. Si sawa kwa gumzo la interactive la chapchap.

Basi hii ni nzuri kwa nini hasa?

Embeddings za faragha, classification, foleni za summarization, pipelines za RAG ambapo latency haihusiki, na kuweka data mbali na APIs za watu wa tatu. Pia: kujifunza, kujaribu, na prototyping kabla ya kukodisha GPU mahali.

Je mnaomba ID?

Hapana. Barua pepe kujisajili, USDC au USDT kulipa. Ambayo mara nyingi ndiyo sababu watu wanataka modeli ya faragha kwanza.

Maoni

Bado hakuna maoni. Kuwa wa kwanza.

Acha maoni

Maoni yanakaguliwa kabla ya kuonekana.