실망스러운 부분을 먼저 치워 둡시다, 인터넷은 그러지 않는 페이지로 가득하니까요.
우리 서버는 CPU 전용입니다. GPU를 제공하지 않습니다. 즉 여기서 로컬 LLM 작업에는 확고한 천장이 있고, 아니라고 꾸미는 것은 그저 당신 돈 낭비입니다.
CPU에서 실제로 되는 것
최대 6 vCPU와 6 GB RAM(우리 Medium 요금제 — 월 $12)으로, 당신은 작은 양자화 모델의 범위에 있습니다:
- 1B–3B 모델(Q4): 정말 쓸 만함. 분류, 태깅, 라우팅, 단순 구조화 추출에 충분히 빠름.
- 7B–8B 모델(Q4): 되지만 초당 몇 토큰을 예상하세요. 밤새 문서를 씹어 넘기는 큐에는 괜찮음. 채팅 창으로는 괴로움.
- 임베딩 모델: 훌륭한 합. 작고, CPU에서 빠르며, 이것이 아마 우리 같은 박스에서 Ollama를 돌리는 단일 최고의 이유입니다.
- 13B 이상: 하지 마세요. 스왑하며 기다리게 됩니다.
빠르고 대화식인 70B 채팅이 필요하면 GPU 호스트가 필요합니다 — 그것은 다른 제공자의 다른 제품이고, 당신의 $12를 받느니 그렇게 말하겠습니다.
CPU 박스가 진짜 이기는 곳
프라이버시. 당신의 문서, 프롬프트, 임베딩 — 통제하는 기기를 결코 떠나지 않고, 누군가의 훈련 데이터가 되지 않습니다. 많은 사람에게 그것이 전체 요점이고, 초당 몇 토큰은 받아들일 만한 거래입니다.
비용 예측 가능성. 토큰당 청구 없음. 5만 레코드를 분류하는 파이프라인이 50개를 분류하는 것과 같은 비용: $12.
비동기 작업. 가장 유용한 LLM 작업은 채팅 창이 아닙니다. 큐입니다: 이것들을 요약, 저것들을 태그, 이 코퍼스를 임베드. CPU 박스가 밤새 백로그를 가는 것은 그것에 완벽히 알맞습니다.
설정
# Ubuntu 24.04 — Medium 요금제 권장
curl -fsSL https://ollama.com/install.sh | sh
# 작은 것부터 시작해 직접 보기
ollama pull llama3.2:3b
ollama run llama3.2:3b "Summarize this in one sentence: ..."
# 임베딩 — CPU의 스위트 스폿
ollama pull nomic-embed-text
curl http://localhost:11434/api/embeddings \
-d '{"model":"nomic-embed-text","prompt":"hello world"}'
Ollama는 localhost:11434에서 HTTP API를 제공합니다. 거기 두세요. 다른 데서 닿아야 하면 전용 IP 요금제에서 인증이 있는 리버스 프록시 뒤에 두세요 — 인증 없는 모델 엔드포인트를 열린 인터넷에 절대 노출하지 마세요.
벡터 데이터베이스와 짝지으면(Docker의 Qdrant나 pgvector), 하나의 $12 박스에 완전한 프라이빗 RAG 스택이 생깁니다. 그 조합 — 작은 로컬 임베딩, 로컬 벡터 스토어, 무거운 생성 단계만 외부 API — 이 이런 하드웨어에서 실제로 말이 되는 설정입니다.
요금제 고르기
| 용도 | 요금제 | 가격 |
|---|---|---|
| 임베딩, 1–3B 모델, RAG 파이프라인 | Medium | 월 $12 |
| 같은 것에 인증 뒤의 공개 엔드포인트 | Medium-IP | 월 $20 |
| 그냥 작은 모델 테스트 | Small | 월 $8 |
CPU 전용, 최대 6 vCPU와 6 GB RAM. NVMe 저장소, 무제한 트래픽, 독일이나 핀란드. 암호화폐 결제, KYC 없음. 연간 청구는 12번이 아니라 1번의 송금입니다.
관련 읽을거리
- AI 기억용 벡터 DB 호스팅하기 — 프라이빗 RAG 스택의 나머지 절반
- AI 에이전트용 VPS — 같은 박스에서의 오케스트레이션
준비됐나요? 서버 배포 → — 약 1분 만에 가동, 암호화폐로 결제, 신분증 불필요.
댓글
아직 댓글이 없습니다. 첫 번째가 되세요.