EQVPS

VPS สำหรับ Ollama และ LLM ในเครื่อง

โฮสต์โมเดลภาษาเล็กเองบนเซิร์ฟเวอร์ CPU — เป็นส่วนตัว ไม่จำกัดปริมาณ จ่ายด้วยคริปโต ตรงไปตรงมาเรื่องสิ่งที่การอนุมาน CPU ทำได้และทำไม่ได้ เริ่มต้น $12/เดือน

มาจัดการส่วนที่น่าผิดหวังก่อน เพราะอินเทอร์เน็ตเต็มไปด้วยหน้าที่ไม่ทำ

เซิร์ฟเวอร์ของเราเป็น CPU-only เราไม่มี GPU นั่นหมายความว่างาน LLM ในเครื่องที่นี่มีเพดานตายตัว และการแสร้งเป็นอย่างอื่นก็แค่เสียเงินคุณ

สิ่งที่ทำงานได้จริงบน CPU

ด้วย vCPU สูงสุด 6 ตัวและ RAM 6 GB (แพ็กเกจ Medium — $12/เดือน ของเรา) คุณอยู่ในช่วงของ โมเดล quantized เล็ก:

หากคุณต้องการแชท 70B โต้ตอบเร็ว คุณต้องการโฮสต์ GPU — นั่นเป็นผลิตภัณฑ์ต่างจากผู้ให้บริการต่าง และเราขอบอกคุณดีกว่ารับ $12 ของคุณ

ที่ที่เครื่อง CPU ชนะอย่างแท้จริง

ความเป็นส่วนตัว เอกสารของคุณ พรอมต์ของคุณ embeddings ของคุณ — ไม่เคยออกจากเครื่องที่คุณควบคุม ไม่เคยกลายเป็นข้อมูลฝึกของใคร สำหรับคนจำนวนมากนั่นคือจุดประสงค์ทั้งหมด และไม่กี่โทเคนต่อวินาทีคือการแลกเปลี่ยนที่ยอมรับได้

ต้นทุนที่คาดเดาได้ ไม่มีบิลต่อโทเคน ไปป์ไลน์ที่จำแนกห้าหมื่นระเบียนราคาเท่ากับตัวที่จำแนกห้าสิบ: $12

งาน async งาน LLM ที่มีประโยชน์ส่วนใหญ่ไม่ใช่หน้าต่างแชท มันคือคิว: สรุปพวกนี้ ติดแท็กพวกนั้น embed corpus นี้ เครื่อง CPU ที่บดงานค้างข้ามคืนดีกับสิ่งนั้นอย่างสมบูรณ์

การตั้งค่า

# Ubuntu 24.04 — แนะนำแพ็กเกจ Medium
curl -fsSL https://ollama.com/install.sh | sh

# เริ่มด้วยอะไรเล็ก ๆ และดูด้วยตัวเอง
ollama pull llama3.2:3b
ollama run llama3.2:3b "Summarize this in one sentence: ..."

# Embeddings — จุดที่ลงตัวสำหรับ CPU
ollama pull nomic-embed-text
curl http://localhost:11434/api/embeddings \
  -d '{"model":"nomic-embed-text","prompt":"hello world"}'

Ollama ให้บริการ HTTP API บน localhost:11434 เก็บมันไว้ที่นั่น หากคุณต้องเข้าถึงจากที่อื่น วางมันหลัง reverse proxy พร้อมการยืนยันตัวตนบน แพ็กเกจ dedicated-IP — ไม่เคยเปิด endpoint โมเดลที่ไม่มีการยืนยันตัวตนต่ออินเทอร์เน็ตเปิด

จับคู่กับ vector database (Qdrant หรือ pgvector ใน Docker) แล้วคุณมีสแตก RAG ส่วนตัวครบบนเครื่อง $12 เดียว การผสมนั้น — embeddings เล็กในเครื่อง, vector store ในเครื่อง, API ภายนอกเฉพาะขั้นการสร้างหนัก — คือการตั้งค่าที่สมเหตุสมผลจริงบนฮาร์ดแวร์อย่างนี้

เลือกแพ็กเกจ

การใช้แพ็กเกจราคา
Embeddings, โมเดล 1–3B, ไปป์ไลน์ RAGMedium$12/เดือน
เหมือนกัน บวก endpoint สาธารณะหลัง authMedium-IP$20/เดือน
แค่ทดสอบโมเดลเล็กSmall$8/เดือน

CPU-only, vCPU สูงสุด 6 ตัวและ RAM 6 GB พื้นที่ NVMe ทราฟฟิกไม่จำกัด เยอรมนีหรือฟินแลนด์ จ่ายด้วยคริปโต ไม่ต้อง KYC การเรียกเก็บรายปีคือการโอนครั้งเดียวแทนสิบสองครั้ง

อ่านที่เกี่ยวข้อง


พร้อมไหม? ติดตั้งเซิร์ฟเวอร์ → — ออนไลน์ในเวลาประมาณหนึ่งนาที จ่ายด้วยคริปโต ไม่ต้องใช้ ID

พร้อม deploy แล้วหรือยัง? จ่ายด้วยคริปโต ไม่ต้อง KYC — ใช้งานได้ในราวหนึ่งนาที

Deploy เลย →

FAQ

ฉันรัน Llama 70B บนนี้ได้ไหม?

ไม่ แพ็กเกจของเราเป็น CPU-only ที่มี RAM สูงสุด 6 GB — นั่นคือช่วงของโมเดล quantized เล็ก (ราว 1B–8B ที่ 4-bit) โมเดล 70B ต้องการ GPU และหน่วยความจำมากกว่ามาก เราไม่มี GPU และเราขอบอกอย่างนั้นดีกว่าขายความผิดหวังให้คุณ

การอนุมาน CPU เร็วแค่ไหนจริง ๆ?

คาดหวังไม่กี่โทเคนต่อวินาทีบนโมเดล 7–8B ที่ quantization 4-bit และดีกว่าอย่างสังเกตได้บนโมเดล 1–3B นั่นโอเคสำหรับงานพื้นหลัง embeddings การจำแนก และไปป์ไลน์ async มันไม่โอเคสำหรับแชทโต้ตอบที่ฉับไว

แล้วสิ่งนี้ดีสำหรับอะไรจริง ๆ?

embeddings ส่วนตัว การจำแนก คิวการสรุป ไปป์ไลน์ RAG ที่ความหน่วงไม่สำคัญ และการเก็บข้อมูลพ้นจาก API บุคคลที่สาม รวมถึง: การเรียนรู้ การทดสอบ และการสร้างต้นแบบก่อนเช่า GPU ที่ไหนสักแห่ง

คุณขอ ID ไหม?

ไม่ อีเมลเพื่อลงทะเบียน USDC หรือ USDT เพื่อจ่าย ซึ่งมักเป็นเหตุผลที่คนต้องการโมเดลส่วนตัวตั้งแต่แรก

ความคิดเห็น

ยังไม่มีความคิดเห็น เป็นคนแรกสิ

แสดงความคิดเห็น

ความคิดเห็นจะถูกตรวจสอบก่อนแสดง