EQVPS

VPS til Ollama og lokale LLM'er

Selv-host små sprogmodeller på en CPU-server — privat, unmetered, betalt i krypto. Ærlig om, hvad CPU-inferens kan og ikke kan. Fra $12/md.

Lad os få den skuffende del af vejen, for internettet er fuldt af sider, der ikke gør det.

Vores servere er kun-CPU. Vi tilbyder ikke GPU'er. Det betyder, at lokalt LLM-arbejde her har et hårdt loft, og at lade som om andet ville bare spilde dine penge.

Hvad der faktisk virker på CPU

Med op til 6 vCPU og 6 GB RAM (vores Medium-plan — $12/md) er du i rækkevidden af små kvantiserede modeller:

Hvis du har brug for en hurtig, interaktiv 70B-chat, har du brug for en GPU-vært — det er et andet produkt fra en anden udbyder, og det vil vi hellere fortælle dig end tage dine $12.

Hvor en CPU-boks for alvor vinder

Privatliv. Dine dokumenter, dine prompts, dine embeddings — forlader aldrig en maskine, du kontrollerer, bliver aldrig nogens træningsdata. For mange mennesker er det hele pointen, og et par tokens i sekundet er en acceptabel handel.

Omkostningsforudsigelighed. Ingen per-token-regning. En pipeline, der klassificerer halvtreds tusinde poster, koster det samme som en, der klassificerer halvtreds: $12.

Async-arbejde. Det meste nyttige LLM-arbejde er ikke et chatvindue. Det er en kø: opsummér disse, tag de der, embed dette korpus. En CPU-boks, der maler gennem en backlog natten over, er helt god til det.

Opsætning

# Ubuntu 24.04 — Medium plan recommended
curl -fsSL https://ollama.com/install.sh | sh

# Start with something small and see for yourself
ollama pull llama3.2:3b
ollama run llama3.2:3b "Summarize this in one sentence: ..."

# Embeddings — the sweet spot for CPU
ollama pull nomic-embed-text
curl http://localhost:11434/api/embeddings \
  -d '{"model":"nomic-embed-text","prompt":"hello world"}'

Ollama betjener et HTTP-API på localhost:11434. Hold det der. Hvis du har brug for at nå det andetsteds fra, så sæt det bag en reverse proxy med autentificering på en dedikeret-IP-plan — eksponer aldrig et uautentificeret model-endpoint til det åbne internet.

Kombinér det med en vektordatabase (Qdrant eller pgvector i Docker), og du har en komplet privat RAG-stak på én $12-boks. Den kombination — små lokale embeddings, lokalt vektor-store, eksternt API kun til det tunge genereringstrin — er opsætningen, der faktisk giver mening på hardware som denne.

At vælge en plan

BrugPlanPris
Embeddings, 1–3B-modeller, RAG-pipelineMedium$12/md
Samme, plus et offentligt endpoint bag authMedium-IP$20/md
Bare test af små modellerSmall$8/md

Kun-CPU, op til 6 vCPU og 6 GB RAM. NVMe-lagring, unmetered trafik, Tyskland eller Finland. Kryptobetaling, ingen KYC. Årlig fakturering er én overførsel i stedet for tolv.

Relateret læsning


Klar? Deploy en server → — live på cirka et minut, betalt i krypto, intet ID påkrævet.

Klar til at deploye? Betal med krypto, ingen KYC — live på cirka et minut.

Deploy nu →

FAQ

Kan jeg køre Llama 70B på dette?

Nej. Vores planer er kun-CPU med op til 6 GB RAM — det er rækkevidden af små kvantiserede modeller (cirka 1B–8B ved 4-bit). En 70B-model har brug for en GPU og langt mere hukommelse. Vi tilbyder ikke GPU'er, og vi vil hellere sige det end sælge dig en skuffelse.

Hvor hurtig er CPU-inferens, virkelig?

Forvent et par tokens i sekundet på en 7–8B-model ved 4-bit-kvantisering, og mærkbart bedre på 1–3B-modeller. Det er fint til baggrundsjobs, embeddings, klassificering og async-pipelines. Det er ikke fint til en snappy interaktiv chat.

Så hvad er dette faktisk godt til?

Private embeddings, klassificering, opsummeringskøer, RAG-pipelines hvor latenstid ikke betyder noget, og at holde data væk fra tredjeparts-API'er. Også: læring, test og prototyping, før du lejer en GPU et sted.

Beder I om ID?

Nej. E-mail for at registrere, USDC eller USDT for at betale. Hvilket ofte er grunden til, at folk vil have en privat model i første omgang.

Kommentarer

Ingen kommentarer endnu. Vær den første.

Skriv en kommentar

Kommentarer modereres, før de vises.