ለOllama እና ትንንሽ models የተለየ ገጽ አለን — ያ 1B–8B እና embeddings የሚያሄደው የ$12 CPU box ነው። ይህ ገጽ ሌላኛው ጫፍ ነው: RAM፣ CPU ሳይሆን፣ የሚያስቆምዎ የሆኑ ትልቅ models።
እንደ ሁሉም ቦታ አስቀድሞ ታማኝ እንሁን: ሰርቨሮቻችን CPU-only ናቸው፣ GPU የለም። እዚህ ትልቅ model በዝግታ ይሄዳል። በ30B model ላይ ፈጣን interactive chat ከፈለጉ፣ GPU host ያስፈልግዎታል — የተለየ product፣ የተለየ provider። high-memory CPU box በደንብ የሚያደርገው ትልቅ quantized modelን chat window ላልሆነ ስራ በግል ማሄድ ነው።
የRAM ሂሳብ
modelው በmemory ውስጥ ይቀመጣል፣ quantized ይሁን አይሁን፣ ለcontext እና ለruntime overhead በተጨማሪ:
- 13B፣ 4-bit — በግምት 10–16 GB። አስቀድሞ በmid plan ላይ ይሄዳል።
- 30B-class፣ quantized — በquantization መሠረት 24–48 GB። ይህ Pro-32 እስከ Pro-64 ግዛት ነው።
- ትልቅ ወይም ከፍተኛ precision — 64–80 GB፣ እና ከ80 GB ባሻገር የእኛ አንድም box አይገጥምም። Pro-80 እዚህ ጣሪያው ነው።
ለዚህም ነው "ትልቅ local model ማሄድ" በእውነት የhigh-memory ጥያቄ የሆነው። modelው memory footprintው ነው። በተመሳሳይ host ላይ RAG index ይጨምሩ እና ቁጥሮቹ ይደረታሉ።
private-first በእውነት የሚያሸንፍበት
ጉዳዩ ፍጥነት አይደለም ወጪም አይደለም — አንዳንድ ውሂብ መውጣት አለመቻሉ ነው። ሕጋዊ documents። የሕክምና records። ባለቤትነት ያለው code። promptን ወደ third-party API መላክ የማይታሰብበት ማንኛውም ነገር። ሙሉ በሙሉ በማሽንዎ ላይ የሚሄድ ዝግ model የሚልኩትን ሁሉ የሚlog ፈጣንን ይበልጣል። ሙሉ ምስሉን እዚህ ጻፍን።
እና ውሂቡ ያ ያህል ሚስጥራዊ ከሆነ፣ ክፍያውም ምናልባት የግል መሆን አለበት። boxን በክሪፕቶ እና no-KYC መከራየት ሙሉ ሰንሰለቱን — server፣ model፣ prompts፣ billing — ከማንም የማንነት records ውጭ ያደርገዋል። ፒቹ ያ ነው: ርካሽ inference ሳይሆን፣ ማንም ሌላ ሊያየው የማይችል inference።
ምን መምረጥ
ለcontext ቦታ ላለው 30B-class model፣ Pro-64 (64 GB) ምቹው ምርጫ ነው፤ ጠበቅ ያለ quantization Pro-32 ወይም Pro-48 ይመጥናል፣ ትልቅ ወደ Pro-80 ይሄዳል። modelን መጀመሪያ ይጫኑ፣ resident memory ይመልከቱ፣ ከለኩት ይመዝኑ። እና ተስፋዎችን ያዘጋጁ: ይህ private batch inference ነው፣ ፈጣን chat window አይደለም።
አስተያየቶች
እስካሁን አስተያየቶች የሉም። መጀመሪያ ይሁኑ።