EQVPS

VPS ל-Ollama ו-LLMs מקומיים

אחסנו-בעצמכם מודלי שפה קטנים על שרת CPU — פרטי, ללא מדידה, בתשלום קריפטו. כנים לגבי מה ש-inference על CPU כן ולא יכול לעשות. החל מ-$12/חודש.

בואו נסדר את החלק המאכזב, כי האינטרנט מלא בדפים שלא עושים זאת.

השרתים שלנו הם CPU-בלבד. אנחנו לא מציעים GPUs. זה אומר שעבודת LLM מקומית כאן יש לה תקרה קשיחה, ולהעמיד פנים אחרת סתם יבזבז את הכסף שלכם.

מה בעצם עובד על CPU

עם עד 6 vCPU ו-6 GB של RAM (תוכנית ה-Medium שלנו — $12/חודש), אתם בטווח של מודלים קוונטיזיים קטנים:

אם אתם צריכים צ'אט 70B מהיר ואינטראקטיבי, אתם צריכים מארח GPU — זה מוצר אחר מספק אחר, ואנחנו מעדיפים לומר לכם מאשר לקחת את ה-$12 שלכם.

היכן ארגז CPU באמת מנצח

פרטיות. המסמכים שלכם, ה-prompts שלכם, ה-embeddings שלכם — לעולם לא עוזבים מכונה שאתם שולטים בה, לעולם לא הופכים לנתוני אימון של מישהו. להרבה אנשים זה כל העניין, וכמה טוקנים לשנייה הם עסקה מקובלת.

צפיות עלות. ללא חשבון לפי-טוקן. pipeline שמסווג חמישים אלף רשומות עולה כמו אחד שמסווג חמישים: $12.

עבודה אסינכרונית. רוב עבודת ה-LLM השימושית אינה חלון צ'אט. זה תור: סכם את אלה, תייג את אלה, embed את הקורפוס הזה. ארגז CPU שטוחן backlog לאורך הלילה טוב בזה בהחלט.

הגדרה

# Ubuntu 24.04 — Medium plan recommended
curl -fsSL https://ollama.com/install.sh | sh

# Start with something small and see for yourself
ollama pull llama3.2:3b
ollama run llama3.2:3b "Summarize this in one sentence: ..."

# Embeddings — the sweet spot for CPU
ollama pull nomic-embed-text
curl http://localhost:11434/api/embeddings \
  -d '{"model":"nomic-embed-text","prompt":"hello world"}'

Ollama מגיש API של HTTP על localhost:11434. השאירו אותו שם. אם אתם צריכים להגיע אליו ממקום אחר, שימו אותו מאחורי reverse proxy עם אימות על תוכנית עם IP ייעודי — לעולם אל תחשפו נקודת קצה של מודל ללא אימות לאינטרנט הפתוח.

שדכו אותו עם מסד נתונים וקטורי (Qdrant או pgvector ב-Docker) ויש לכם stack RAG פרטי שלם על ארגז אחד של $12. הצירוף הזה — embeddings מקומיים קטנים, vector store מקומי, API חיצוני רק לשלב היצירה הכבד — הוא ההגדרה שבאמת הגיונית על חומרה כזו.

בחירת תוכנית

שימושתוכניתמחיר
embeddings, מודלים של 1–3B, pipeline של RAGMedium$12/חודש
אותו דבר, בתוספת נקודת קצה ציבורית מאחורי אימותMedium-IP$20/חודש
סתם בודקים מודלים קטניםSmall$8/חודש

CPU-בלבד, עד 6 vCPU ו-6 GB RAM. אחסון NVMe, תעבורה ללא מדידה, גרמניה או פינלנד. תשלום בקריפטו, ללא KYC. חיוב שנתי הוא העברה אחת במקום שתים-עשרה.

קריאה קשורה


מוכנים? הקימו שרת → — חי בערך תוך דקה, בתשלום קריפטו, ללא תעודה נדרשת.

מוכנים להקים? שלמו בקריפטו, ללא KYC — חי בערך תוך דקה.

הקימו עכשיו →

שאלות נפוצות

האם אני יכול להריץ על זה את Llama 70B?

לא. התוכניות שלנו הן CPU-בלבד עם עד 6 GB של RAM — זה הטווח של מודלים קוונטיזיים קטנים (בערך 1B–8B ב-4-bit). מודל 70B צריך GPU והרבה יותר זיכרון. אנחנו לא מציעים GPUs, ואנחנו מעדיפים לומר זאת מאשר למכור לכם אכזבה.

כמה מהיר inference על CPU, באמת?

צפו לכמה טוקנים לשנייה על מודל 7–8B בקוונטיזציה של 4-bit, ובאופן ניכר טוב יותר על מודלים של 1–3B. זה בסדר ל-jobs ברקע, embeddings, סיווג, ו-pipelines אסינכרוניים. זה לא בסדר לצ'אט אינטראקטיבי זריז.

אז למה זה בעצם טוב?

embeddings פרטיים, סיווג, תורי סיכום, pipelines של RAG שבהם השהיה לא משנה, ולשמור נתונים מחוץ ל-APIs של צד שלישי. גם: למידה, בדיקות, ו-prototyping לפני ששוכרים GPU במקום כלשהו.

האם אתם מבקשים תעודה?

לא. אימייל להרשמה, USDC או USDT לתשלום. שזו לעתים קרובות הסיבה שאנשים רוצים מודל פרטי מלכתחילה.

תגובות

אין עדיין תגובות. היו הראשונים.

השאירו תגובה

התגובות עוברות מודרציה לפני שהן מופיעות.