בואו נסדר את החלק המאכזב, כי האינטרנט מלא בדפים שלא עושים זאת.
השרתים שלנו הם CPU-בלבד. אנחנו לא מציעים GPUs. זה אומר שעבודת LLM מקומית כאן יש לה תקרה קשיחה, ולהעמיד פנים אחרת סתם יבזבז את הכסף שלכם.
מה בעצם עובד על CPU
עם עד 6 vCPU ו-6 GB של RAM (תוכנית ה-Medium שלנו — $12/חודש), אתם בטווח של מודלים קוונטיזיים קטנים:
- מודלים של 1B–3B (Q4): שמישים באמת. מהירים מספיק לסיווג, תיוג, ניתוב, וחילוץ מובנה פשוט.
- מודלים של 7B–8B (Q4): רצים, אבל צפו לכמה טוקנים לשנייה. בסדר לתור שלועס מסמכים לאורך הלילה. כואב כחלון צ'אט.
- מודלי embedding: התאמה מצוינת. הם קטנים, מהירים על CPU, וזו כנראה הסיבה הבודדת הטובה ביותר להריץ Ollama על ארגז כמו שלנו.
- 13B ומעלה: אל. תעשו swap ותחכו.
אם אתם צריכים צ'אט 70B מהיר ואינטראקטיבי, אתם צריכים מארח GPU — זה מוצר אחר מספק אחר, ואנחנו מעדיפים לומר לכם מאשר לקחת את ה-$12 שלכם.
היכן ארגז CPU באמת מנצח
פרטיות. המסמכים שלכם, ה-prompts שלכם, ה-embeddings שלכם — לעולם לא עוזבים מכונה שאתם שולטים בה, לעולם לא הופכים לנתוני אימון של מישהו. להרבה אנשים זה כל העניין, וכמה טוקנים לשנייה הם עסקה מקובלת.
צפיות עלות. ללא חשבון לפי-טוקן. pipeline שמסווג חמישים אלף רשומות עולה כמו אחד שמסווג חמישים: $12.
עבודה אסינכרונית. רוב עבודת ה-LLM השימושית אינה חלון צ'אט. זה תור: סכם את אלה, תייג את אלה, embed את הקורפוס הזה. ארגז CPU שטוחן backlog לאורך הלילה טוב בזה בהחלט.
הגדרה
# Ubuntu 24.04 — Medium plan recommended
curl -fsSL https://ollama.com/install.sh | sh
# Start with something small and see for yourself
ollama pull llama3.2:3b
ollama run llama3.2:3b "Summarize this in one sentence: ..."
# Embeddings — the sweet spot for CPU
ollama pull nomic-embed-text
curl http://localhost:11434/api/embeddings \
-d '{"model":"nomic-embed-text","prompt":"hello world"}'
Ollama מגיש API של HTTP על localhost:11434. השאירו אותו שם. אם אתם צריכים להגיע אליו ממקום אחר, שימו אותו מאחורי reverse proxy עם אימות על תוכנית עם IP ייעודי — לעולם אל תחשפו נקודת קצה של מודל ללא אימות לאינטרנט הפתוח.
שדכו אותו עם מסד נתונים וקטורי (Qdrant או pgvector ב-Docker) ויש לכם stack RAG פרטי שלם על ארגז אחד של $12. הצירוף הזה — embeddings מקומיים קטנים, vector store מקומי, API חיצוני רק לשלב היצירה הכבד — הוא ההגדרה שבאמת הגיונית על חומרה כזו.
בחירת תוכנית
| שימוש | תוכנית | מחיר |
|---|---|---|
| embeddings, מודלים של 1–3B, pipeline של RAG | Medium | $12/חודש |
| אותו דבר, בתוספת נקודת קצה ציבורית מאחורי אימות | Medium-IP | $20/חודש |
| סתם בודקים מודלים קטנים | Small | $8/חודש |
CPU-בלבד, עד 6 vCPU ו-6 GB RAM. אחסון NVMe, תעבורה ללא מדידה, גרמניה או פינלנד. תשלום בקריפטו, ללא KYC. חיוב שנתי הוא העברה אחת במקום שתים-עשרה.
קריאה קשורה
- אחסון vector DB לזיכרון AI — החצי השני של stack RAG פרטי
- VPS לסוכני AI — תזמור על אותו ארגז
מוכנים? הקימו שרת → — חי בערך תוך דקה, בתשלום קריפטו, ללא תעודה נדרשת.
תגובות
אין עדיין תגובות. היו הראשונים.