Tuwe wa uaminifu mwanzoni: kama unataka generation ya haraka, nafuu, ya ubora wa juu, piga API. CPU VPS haitamzidi datacenter iliyojaa GPUs, na yeyote anayekuambia vinginevyo anauza kitu.
Basi kwa nini kujihifadhi inference kabisa? Sababu moja, nayo ni nzuri: modeli kwenye seva yako kamwe haitumi prompts zako popote.
CPU inference inaonekanaje hasa
Unaweza kuendesha modeli halisi kwenye CPU na RAM ya kutosha. Modeli ya 7–8B iliyo-quantized hadi 4-bit inafanya kazi. 13B inafanya kazi. Unaweza hata kusukuma modeli ya darasa la 30B kama una kumbukumbu. Kile usichoweza kufanya ni kuifanya ya haraka — output inakuja kwa tokens chache kwa sekunde, si mkondo wa papo hapo ambao API inakupa.
Hiyo ni biashara ya uaminifu. Kwa gumzo la interactive ni ya kukatisha tamaa. Kwa kazi ya nyuma — kufanya muhtasari wa nyaraka usiku kucha, kuainisha foleni, kuboresha data kwa ratiba — tokens chache kwa sekunde ni sawa kabisa, na hakuna anayeangalia saa.
Hesabu ya RAM
Modeli lazima ikae kwenye kumbukumbu, quantized au si, pamoja na overhead kwa context na runtime:
- 7–8B, 4-bit — karibu 6–8 GB. Inaendesha kwenye mpango wa mid.
- 13B, 4-bit — takriban 10–16 GB.
- Darasa la 30B, quantized — 24–48 GB, kutegemea quantization.
- Kubwa zaidi, au precision ya juu zaidi — uko katika 64–80 GB haraka — na zaidi ya 80 GB hakuna sanduku moja la Pro linalofaa, bado CPU-polepole.
Ndio sababu "endesha local model" kimya inakuwa swali la high-memory. Modeli ndiyo alama ya kumbukumbu. Ongeza RAG index au agents kwenye sanduku lilelile na namba hurundikana.
Ollama dhidi ya vLLM, kwa ufupi
Ollama ndio mlango rahisi wa kuingia — install, ollama run, imekamilika. Ni zana sahihi kwa usanidi wa single-user wa faragha ambapo unataka tu modeli ipatikane. vLLM imejengwa kwa serving throughput: sanidi zaidi, bora chini ya concurrent load, inastahili wakati dhati unashughulikia wingi. Anza na Ollama; fikia vLLM wakati unasrv trafiki halisi.
Wapi private-first inashinda kweli
Hoja ya self-hosted inference si kasi au gharama — ni kwamba data fulani haiwezi kuondoka. Nyaraka za kisheria. Rekodi za kitabibu. Code ya umiliki. Chochote ambapo kutuma prompt kwa API ya mtu wa tatu ni nje ya meza kwa sababu za policy au trust. Modeli ya polepole inayoendesha kabisa kwenye mashine yako humzidi ya haraka inayolog kila kitu unachotuma.
Na kama data ni nyeti hivyo, malipo pengine yanapaswa kuwa ya faragha pia. Kukodisha sanduku kwa crypto na no KYC huweka mnyororo mzima — seva, modeli, prompts, malipo — mbali na rekodi za utambulisho za mtu yeyote. Hiyo ndiyo pitching halisi: si "inference nafuu," bali "inference ambayo hakuna mwingine anaweza kuiona."
Mstari wa chini
Kwa kasi na ubora, tumia API — hakuna aibu. Jihifadhi wakati faragha ndiyo tabo na polepole inakubalika. Weka saizi kwa modeli plus context yake plus chochote kingine kinachoshiriki sanduku, na usitegemee kasi ya GPU kutoka CPU.
Wakati modeli inahitaji kumbukumbu halisi, mstari wa Pro huendesha 32 hadi 80 GB na dedicated IP na nightly backups — ya kutosha kushikilia modeli serious ya quantized na nafasi kwa context kuzunguka.
Maoni
Bado hakuna maoni. Kuwa wa kwanza.