모든 프롬프트를 남의 API로 보내는 것은 괜찮습니다 — 그렇지 않게 되기 전까지는. 데이터가 민감해 서버를 결코 떠나지 않길 바랄 수도. 속도 제한에, 모델 버전이 발밑에서 바뀌는 것에, 실험하는 동안 토큰당 계량이 째깍이는 것에 지쳤을 수도. 어느 시점에 "그냥 내 걸 돌리면?"이 사고 실험이길 멈춥니다.
Ollama가 그것을 정말 쉽게 만듭니다. 더 어려운 질문은 VPS에 무엇이 들어가는가 — 그리고 여기서는 솔직한 답이 과장보다 중요합니다.
CPU에서 실제로 무엇을 돌릴 수 있나
GPU 없음? 그럼 CPU 추론을 하는 것이고, 모델 크기가 전부입니다. 양자화(가중치를 4비트로 짜기)가 이것을 실용적으로 만듭니다 — 품질의 한 조각을 잃고 메모리 한 더미를 아낍니다.
대략적 숫자, 중요한 것들:
- 3B 모델, 4비트 — ~3 GB RAM. 채팅과 간단한 작업에 충분히 빠릿.
- 7B 모델, 4비트 — ~5 GB RAM. 스위트 스폿: 눈에 띄게 더 똑똑하고, 여전히 읽을 수 있는 속도로 돕니다.
- 13B 이상 — 8-10 GB 이상이고 CPU에서 느림. 기술적으로 가능, 실용적으로 성가심.
속도, 솔직히: 몇 vCPU에서 초당 몇 토큰을 봅니다. 타이핑되는 대로 읽는 챗봇이나 코딩 어시스턴트에는 완벽히 괜찮음. 100만 문서를 배치 처리하는 데는 안 맞음 — 그건 GPU 일이고, 우리는 아니라고 꾸미지 않습니다. GPU 인스턴스를 제공하지 않습니다. 요금제에 70B 모델이나 무거운 처리량이 필요하면, CPU VPS — 우리 것이든 누구 것이든 — 는 잘못된 도구이고, 한 푼 쓰기 전에 그것을 알아야 합니다.
하지만 당신의 질문에 답하고 결코 집에 전화하지 않는 프라이빗한 7B? 그것은 6 GB 박스에서 편안히 돕니다.
설치 — 세 명령
서버를 띄우고, SSH로 들어가서:
curl -fsSL https://ollama.com/install.sh | sh # Ollama 설치
ollama run llama3.2:3b # 3B 모델을 풀 + 실행
그게 전부입니다 — 터미널에서 채팅하고 있습니다. 자체 코드에서 쓰려면, Ollama가 이미 포트 11434에서 HTTP API를 제공합니다:
curl http://localhost:11434/api/generate -d '{
"model": "llama3.2:3b",
"prompt": "Summarize this changelog in two lines: ...",
"stream": false
}'
미리 알아둘 함정 하나: 기본으로 그 API는 localhost에 바인딩됩니다. 그대로 두고 SSH로 터널하거나, 아니면 인터넷에 노출됩니다. 닿을 수 있게 하고 싶으면 인증 뒤에 두세요 — 공개 IP에 열린 모델 엔드포인트를 남기지 마세요.
박스 고르기
요금제를 모델에 맞추세요, 반대가 아니라:
| 돌리고 싶은 것 | 필요한 RAM | 온당한 요금제 |
|---|---|---|
| 3B 모델, 가벼운 사용 | ~3 GB | Small (4 GB) |
| 7B 모델, 편안하게 | ~5-6 GB | Medium (6 GB) |
| 더 크게 / 높은 처리량 | GPU 영역 | CPU VPS가 아님 |
대부분의 자체 호스터에게 **Medium (6 GB)**이 솔직한 추천 — 7B 모델과 앱과 OS에 충분한 여유. Small (4 GB)은 3B에 머물면 됩니다. 그 아래는 OS와 컨텍스트가 파고들면 너무 빡빡합니다.
왜 여기서 하나
LLM을 자체 호스팅한다면 프라이버시가 대개 이유의 절반 — 그러니 박스를 빌리려 신분증을 건네는 건 이상합니다. 그럴 필요 없습니다: USDC나 USDT로 낼 수 있고(또는 온램프를 통한 카드), KYC 없이, 서버는 약 1분이면 당신 것입니다. 암호화폐 네이티브, 에이전트 친화, 그리고 데이터는 당신이 통제하는 기기에 남습니다.
트레이드오프는 우리가 솔직했던 그것: CPU 전용, 6 GB 천장, 작은 모델. 그 안에서 자체 호스팅은 훌륭합니다. 그 밖에서는, GPU가 필요한 일에 누군가 당신에게 CPU 박스를 팔게 두지 마세요.
시험할 준비가 됐나요? 요금제를 고르고, 내면, 약 60초 만에 root를 얻습니다 — 그다음 당신만의 프라이빗 모델까지 세 명령입니다.
댓글
아직 댓글이 없습니다. 첫 번째가 되세요.