EQVPS
Anza

VPS kwa private high-memory LLM inference

Modeli kubwa za quantized zinahitaji RAM halisi, si GPU usiyonayo. Wapi sanduku la CPU la high-memory linaendesha modeli za darasa la 30B kwa faragha, kilicho halisi, na wapi si. Kuanzia $70/mwezi.

Tuna ukurasa tofauti kwa Ollama na modeli ndogo — huo ni sanduku la CPU la $12 linaloendesha 1B–8B na embeddings. Ukurasa huu ni mwisho mwingine: modeli kubwa za kutosha kiasi kwamba RAM, si CPU, ndio inayokuzuia.

Tuwe wa uaminifu mwanzoni, sawa na kila mahali: seva zetu ni CPU-pekee, hakuna GPU. Modeli kubwa hapa huendesha polepole. Kama unataka gumzo la interactive la kasi kwenye modeli ya 30B, unahitaji mwenyeji wa GPU — bidhaa tofauti, mtoa huduma tofauti. Kile sanduku la CPU la high-memory hufanya vizuri ni kuendesha modeli kubwa ya quantized kwa faragha kwa kazi isiyo dirisha la gumzo.

Hesabu ya RAM

Modeli hukaa kwenye kumbukumbu, quantized au si, pamoja na overhead kwa context na runtime:

Ndio sababu "endesha modeli kubwa ya ndani" kwa kweli ni swali la high-memory. Modeli ndiyo alama ya kumbukumbu. Ongeza RAG index kwenye mwenyeji uleule na namba hurundikana.

Wapi private-first inashinda kweli

Hoja si kasi wala si gharama — ni kwamba data fulani haiwezi kuondoka. Nyaraka za kisheria. Rekodi za kitabibu. Code ya umiliki. Chochote ambapo kutuma prompt kwa API ya mtu wa tatu ni nje ya meza. Modeli ya polepole inayoendesha kabisa kwenye mashine yako humzidi ya kasi inayolog kila kitu unachotuma. Tuliandika picha kamili hapa.

Na kama data ni nyeti hivyo, malipo pengine yanapaswa kuwa ya faragha pia. Kukodisha sanduku kwa crypto na bila KYC huweka mnyororo mzima — seva, modeli, prompts, malipo — mbali na rekodi za utambulisho za mtu yeyote. Hiyo ndiyo pitching: si inference nafuu, bali inference ambayo hakuna mwingine anaweza kuiona.

Nini cha kuchagua

Kwa modeli ya darasa la 30B yenye nafasi kwa context, Pro-64 (64 GB) ndio chaguo la starehe; quantization finyu zaidi inafaa Pro-32 au Pro-48, kubwa zaidi huenda Pro-80. Pakia modeli kwanza, angalia resident memory, weka saizi kutoka kile ulichokipima. Na weka matarajio: hii ni inference ya batch ya faragha, si dirisha la gumzo la kasi.

Uko tayari kusambaza? Lipa kwa crypto, bila KYC — hai kwa takriban dakika moja.

Sambaza sasa →

Maswali

Hii ni tofauti gani na matumizi yenu ya Ollama?

Ukurasa wa Ollama unahusu modeli ndogo kwenye sanduku la CPU la $12 — 1B–8B, embeddings, kazi nyepesi. Hii ni mwisho wa high-memory: modeli za quantized za 13B hadi darasa la 30B zinazohitaji 24–48 GB au zaidi hata kupakia. Ukweli uleule wa CPU-pekee, alama kubwa zaidi ya kumbukumbu, mpango tofauti.

RAM kiasi gani kwa modeli fulani?

Modeli lazima ifae kwenye kumbukumbu pamoja na overhead. Modeli ya 13B 4-bit inataka ~10–16 GB; darasa la 30B quantized husukuma 24–48 GB; nenda kubwa zaidi au precision ya juu zaidi nawe uko katika 64–80 GB — zaidi ya hapo, hakuna sanduku moja letu linalofaa. Ongeza nafasi kwa context juu yake.

Je itakuwa ya kasi?

Hapana — kuwa wa uaminifu na wewe mwenyewe hapa. CPU inference kwenye modeli kubwa ni tokens chache kwa sekunde, si mkondo wa interactive. Ni sawa kwa kazi ya batch na ya nyuma (fanya muhtasari usiku kucha, ainisha foleni). Kwa gumzo la real-time kwenye modeli kubwa unahitaji GPU, ambayo hatuitoi.

Kwa nini kuiendesha hapa badala ya API?

Faragha. Prompts zako na outputs kamwe hazigusi seva au logs za mtoa huduma. Kwa data nyeti — kisheria, kitabibu, code ya ndani — modeli ya faragha ya polepole humzidi ya kasi inayoona kila kitu. Iunge na malipo ya crypto bila-KYC na mnyororo mzima unabaki wako.

Maoni

Bado hakuna maoni. Kuwa wa kwanza.

Acha maoni

Maoni yanakaguliwa kabla ya kuonekana.