−25%

Windows 연간 결제, 10월 31일까지. 요금제 보기

EQVPS
시작하기

Ollama와 로컬 LLM용 VPS

CPU 서버에서 작은 언어 모델을 자체 호스팅하세요 — 프라이빗, 무제한, 암호화폐로 결제. CPU 추론이 할 수 있는 것과 없는 것에 솔직하게. 월 $12부터.

실망스러운 부분을 먼저 치워 둡시다, 인터넷은 그러지 않는 페이지로 가득하니까요.

우리 서버는 CPU 전용입니다. GPU를 제공하지 않습니다. 즉 여기서 로컬 LLM 작업에는 확고한 천장이 있고, 아니라고 꾸미는 것은 그저 당신 돈 낭비입니다.

CPU에서 실제로 되는 것

최대 6 vCPU와 6 GB RAM(우리 Medium 요금제 — 월 $12)으로, 당신은 작은 양자화 모델의 범위에 있습니다:

  • 1B–3B 모델(Q4): 정말 쓸 만함. 분류, 태깅, 라우팅, 단순 구조화 추출에 충분히 빠름.
  • 7B–8B 모델(Q4): 되지만 초당 몇 토큰을 예상하세요. 밤새 문서를 씹어 넘기는 큐에는 괜찮음. 채팅 창으로는 괴로움.
  • 임베딩 모델: 훌륭한 합. 작고, CPU에서 빠르며, 이것이 아마 우리 같은 박스에서 Ollama를 돌리는 단일 최고의 이유입니다.
  • 13B 이상: 하지 마세요. 스왑하며 기다리게 됩니다.

빠르고 대화식인 70B 채팅이 필요하면 GPU 호스트가 필요합니다 — 그것은 다른 제공자의 다른 제품이고, 당신의 $12를 받느니 그렇게 말하겠습니다.

CPU 박스가 진짜 이기는 곳

프라이버시. 당신의 문서, 프롬프트, 임베딩 — 통제하는 기기를 결코 떠나지 않고, 누군가의 훈련 데이터가 되지 않습니다. 많은 사람에게 그것이 전체 요점이고, 초당 몇 토큰은 받아들일 만한 거래입니다.

비용 예측 가능성. 토큰당 청구 없음. 5만 레코드를 분류하는 파이프라인이 50개를 분류하는 것과 같은 비용: $12.

비동기 작업. 가장 유용한 LLM 작업은 채팅 창이 아닙니다. 큐입니다: 이것들을 요약, 저것들을 태그, 이 코퍼스를 임베드. CPU 박스가 밤새 백로그를 가는 것은 그것에 완벽히 알맞습니다.

설정

# Ubuntu 24.04 — Medium 요금제 권장
curl -fsSL https://ollama.com/install.sh | sh

# 작은 것부터 시작해 직접 보기
ollama pull llama3.2:3b
ollama run llama3.2:3b "Summarize this in one sentence: ..."

# 임베딩 — CPU의 스위트 스폿
ollama pull nomic-embed-text
curl http://localhost:11434/api/embeddings \
  -d '{"model":"nomic-embed-text","prompt":"hello world"}'

Ollama는 localhost:11434에서 HTTP API를 제공합니다. 거기 두세요. 다른 데서 닿아야 하면 전용 IP 요금제에서 인증이 있는 리버스 프록시 뒤에 두세요 — 인증 없는 모델 엔드포인트를 열린 인터넷에 절대 노출하지 마세요.

벡터 데이터베이스와 짝지으면(Docker의 Qdrant나 pgvector), 하나의 $12 박스에 완전한 프라이빗 RAG 스택이 생깁니다. 그 조합 — 작은 로컬 임베딩, 로컬 벡터 스토어, 무거운 생성 단계만 외부 API — 이 이런 하드웨어에서 실제로 말이 되는 설정입니다.

요금제 고르기

용도요금제가격
임베딩, 1–3B 모델, RAG 파이프라인Medium월 $12
같은 것에 인증 뒤의 공개 엔드포인트Medium-IP월 $20
그냥 작은 모델 테스트Small월 $8

CPU 전용, 최대 6 vCPU와 6 GB RAM. NVMe 저장소, 무제한 트래픽, 독일이나 핀란드. 암호화폐 결제, KYC 없음. 연간 청구는 12번이 아니라 1번의 송금입니다.

관련 읽을거리


준비됐나요? 서버 배포 → — 약 1분 만에 가동, 암호화폐로 결제, 신분증 불필요.

Open WebUI용 VPS: LLM을 위한 프라이빗 채팅 화면 →

배포할 준비가 되셨나요? 암호화폐로 결제, KYC 없음 — 약 1분 만에 온라인.

지금 배포 →

FAQ

이것으로 Llama 70B를 돌릴 수 있나요?

아니요. 우리 요금제는 CPU 전용에 최대 6 GB RAM — 그것이 작은 양자화 모델의 범위입니다(4비트로 대략 1B–8B). 70B 모델에는 GPU와 훨씬 더 많은 메모리가 필요합니다. GPU를 제공하지 않고, 실망을 파느니 그렇게 말하겠습니다.

CPU 추론은 실제로 얼마나 빠른가요?

4비트 양자화의 7–8B 모델에서 초당 몇 토큰, 1–3B 모델에서는 눈에 띄게 더 나은 것을 예상하세요. 백그라운드 작업, 임베딩, 분류, 비동기 파이프라인에는 괜찮습니다. 빠릿한 대화식 채팅에는 부적합합니다.

그럼 실제로 무엇에 좋은가요?

프라이빗 임베딩, 분류, 요약 큐, 지연이 문제되지 않는 RAG 파이프라인, 그리고 데이터를 제3자 API에서 멀리 두는 것. 게다가: 어딘가에서 GPU를 빌리기 전에 학습, 테스트, 프로토타입.

신분증을 묻나요?

아니요. 등록은 이메일, 결제는 USDC나 USDT. 그것이 흔히 애초에 사람들이 프라이빗 모델을 원하는 이유입니다.

댓글

아직 댓글이 없습니다. 첫 번째가 되세요.

댓글 남기기

댓글은 표시되기 전에 검토됩니다.