EQVPS

VPS för Ollama och lokala LLM:er

Självhosta små språkmodeller på en CPU-server — privat, omätt, betald i krypto. Ärlig om vad CPU-inferens kan och inte kan. Från $12/mån.

Låt oss få den tråkiga delen ur vägen, för internet är fullt av sidor som inte gör det.

Våra servrar är CPU-only. Vi erbjuder inga GPU:er. Det betyder att lokalt LLM-arbete här har ett hårt tak, och att låtsas annat skulle bara slösa dina pengar.

Vad som faktiskt fungerar på CPU

Med upp till 6 vCPU och 6 GB RAM (vårt Medium-plan — $12/mån) är du i intervallet för små kvantiserade modeller:

Om du behöver en snabb, interaktiv 70B-chatt behöver du en GPU-host — det är en annan produkt från en annan leverantör, och vi berättar det hellre än tar dina $12.

Var en CPU-box verkligen vinner

Integritet. Dina dokument, dina prompter, dina embeddings — lämnar aldrig en maskin du kontrollerar, blir aldrig någons träningsdata. För många är det hela poängen, och ett par tokens i sekunden är en acceptabel avvägning.

Kostnadsförutsägbarhet. Ingen räkning per token. En pipeline som klassificerar femtiotusen poster kostar samma som en som klassificerar femtio: $12.

Asynkront arbete. Det mesta användbara LLM-arbetet är inte ett chattfönster. Det är en kö: sammanfatta dessa, tagga de där, embedda detta korpus. En CPU-box som maler igenom en backlog över natten är perfekt bra på det.

Uppsättning

# Ubuntu 24.04 — Medium plan recommended
curl -fsSL https://ollama.com/install.sh | sh

# Start with something small and see for yourself
ollama pull llama3.2:3b
ollama run llama3.2:3b "Summarize this in one sentence: ..."

# Embeddings — the sweet spot for CPU
ollama pull nomic-embed-text
curl http://localhost:11434/api/embeddings \
  -d '{"model":"nomic-embed-text","prompt":"hello world"}'

Ollama betjänar en HTTP-API på localhost:11434. Håll den där. Om du behöver nå den från annat håll, sätt den bakom en reverse proxy med autentisering på ett dedikerat-IP-plan — exponera aldrig en oautentiserad model-endpoint för det öppna internet.

Para ihop den med en vektordatabas (Qdrant eller pgvector i Docker) och du har en komplett privat RAG-stack på en $12-box. Den kombinationen — små lokala embeddings, lokal vektorlagring, externt API bara för det tunga genereringssteget — är uppsättningen som faktiskt är meningsfull på hårdvara som denna.

Att välja en plan

AnvändningPlanPris
Embeddings, 1–3B-modeller, RAG-pipelineMedium$12/mån
Samma, plus en publik endpoint bakom authMedium-IP$20/mån
Bara testa små modellerSmall$8/mån

CPU-only, upp till 6 vCPU och 6 GB RAM. NVMe-lagring, omätt trafik, Tyskland eller Finland. Kryptobetalning, ingen KYC. Årlig fakturering är en överföring istället för tolv.

Relaterad läsning


Redo? Distribuera en server → — live på ungefär en minut, betald i krypto, inget ID krävs.

Redo att distribuera? Betala med krypto, ingen KYC — igång på ungefär en minut.

Distribuera nu →

FAQ

Kan jag köra Llama 70B på detta?

Nej. Våra planer är CPU-only med upp till 6 GB RAM — det är intervallet för små kvantiserade modeller (ungefär 1B–8B vid 4-bit). En 70B-modell behöver en GPU och långt mer minne. Vi erbjuder inga GPU:er, och vi säger det hellre än säljer dig en besvikelse.

Hur snabb är CPU-inferens, egentligen?

Förvänta dig ett par tokens i sekunden på en 7–8B-modell vid 4-bit-kvantisering, och märkbart bättre på 1–3B-modeller. Det är bra för bakgrundsjobb, embeddings, klassificering och asynkrona pipelines. Det är inte bra för en snabb interaktiv chatt.

Så vad är detta faktiskt bra för?

Privata embeddings, klassificering, sammanfattningsköer, RAG-pipelines där latens inte spelar roll, och att hålla data borta från tredjeparts-API:er. Även: lärande, testning och prototyping innan du hyr en GPU någonstans.

Ber ni om ID?

Nej. E-post för att registrera dig, USDC eller USDT för att betala. Vilket ofta är anledningen till att folk vill ha en privat modell från första början.

Kommentarer

Inga kommentarer än. Bli först.

Lämna en kommentar

Kommentarer modereras innan de visas.