Tuna ukurasa tofauti kwa Ollama na modeli ndogo — huo ni sanduku la CPU la $12 linaloendesha 1B–8B na embeddings. Ukurasa huu ni mwisho mwingine: modeli kubwa za kutosha kiasi kwamba RAM, si CPU, ndio inayokuzuia.
Tuwe wa uaminifu mwanzoni, sawa na kila mahali: seva zetu ni CPU-pekee, hakuna GPU. Modeli kubwa hapa huendesha polepole. Kama unataka gumzo la interactive la kasi kwenye modeli ya 30B, unahitaji mwenyeji wa GPU — bidhaa tofauti, mtoa huduma tofauti. Kile sanduku la CPU la high-memory hufanya vizuri ni kuendesha modeli kubwa ya quantized kwa faragha kwa kazi isiyo dirisha la gumzo.
Hesabu ya RAM
Modeli hukaa kwenye kumbukumbu, quantized au si, pamoja na overhead kwa context na runtime:
- 13B, 4-bit — takriban 10–16 GB. Huendesha kwenye mpango wa mid tayari.
- Darasa la 30B, quantized — 24–48 GB kutegemea quantization. Hili ni eneo la Pro-32 hadi Pro-64.
- Kubwa zaidi au precision ya juu zaidi — 64–80 GB, na zaidi ya 80 GB hakuna sanduku moja letu linalofaa. Pro-80 ndiyo dari hapa.
Ndio sababu "endesha modeli kubwa ya ndani" kwa kweli ni swali la high-memory. Modeli ndiyo alama ya kumbukumbu. Ongeza RAG index kwenye mwenyeji uleule na namba hurundikana.
Wapi private-first inashinda kweli
Hoja si kasi wala si gharama — ni kwamba data fulani haiwezi kuondoka. Nyaraka za kisheria. Rekodi za kitabibu. Code ya umiliki. Chochote ambapo kutuma prompt kwa API ya mtu wa tatu ni nje ya meza. Modeli ya polepole inayoendesha kabisa kwenye mashine yako humzidi ya kasi inayolog kila kitu unachotuma. Tuliandika picha kamili hapa.
Na kama data ni nyeti hivyo, malipo pengine yanapaswa kuwa ya faragha pia. Kukodisha sanduku kwa crypto na bila KYC huweka mnyororo mzima — seva, modeli, prompts, malipo — mbali na rekodi za utambulisho za mtu yeyote. Hiyo ndiyo pitching: si inference nafuu, bali inference ambayo hakuna mwingine anaweza kuiona.
Nini cha kuchagua
Kwa modeli ya darasa la 30B yenye nafasi kwa context, Pro-64 (64 GB) ndio chaguo la starehe; quantization finyu zaidi inafaa Pro-32 au Pro-48, kubwa zaidi huenda Pro-80. Pakia modeli kwanza, angalia resident memory, weka saizi kutoka kile ulichokipima. Na weka matarajio: hii ni inference ya batch ya faragha, si dirisha la gumzo la kasi.
Maoni
Bado hakuna maoni. Kuwa wa kwanza.