−25%

Windows 연간 결제, 10월 31일까지. 요금제 보기

EQVPS
시작하기

Ollama로 VPS에 로컬 LLM 자체 호스팅하기 — 실제로 되는 것

2026년 6월 14일 · 2 분 읽기 · EQVPS Team

모든 프롬프트를 남의 API로 보내는 것은 괜찮습니다 — 그렇지 않게 되기 전까지는. 데이터가 민감해 서버를 결코 떠나지 않길 바랄 수도. 속도 제한에, 모델 버전이 발밑에서 바뀌는 것에, 실험하는 동안 토큰당 계량이 째깍이는 것에 지쳤을 수도. 어느 시점에 "그냥 내 걸 돌리면?"이 사고 실험이길 멈춥니다.

Ollama가 그것을 정말 쉽게 만듭니다. 더 어려운 질문은 VPS에 무엇이 들어가는가 — 그리고 여기서는 솔직한 답이 과장보다 중요합니다.

CPU에서 실제로 무엇을 돌릴 수 있나

GPU 없음? 그럼 CPU 추론을 하는 것이고, 모델 크기가 전부입니다. 양자화(가중치를 4비트로 짜기)가 이것을 실용적으로 만듭니다 — 품질의 한 조각을 잃고 메모리 한 더미를 아낍니다.

대략적 숫자, 중요한 것들:

  • 3B 모델, 4비트 — ~3 GB RAM. 채팅과 간단한 작업에 충분히 빠릿.
  • 7B 모델, 4비트 — ~5 GB RAM. 스위트 스폿: 눈에 띄게 더 똑똑하고, 여전히 읽을 수 있는 속도로 돕니다.
  • 13B 이상 — 8-10 GB 이상이고 CPU에서 느림. 기술적으로 가능, 실용적으로 성가심.

속도, 솔직히: 몇 vCPU에서 초당 몇 토큰을 봅니다. 타이핑되는 대로 읽는 챗봇이나 코딩 어시스턴트에는 완벽히 괜찮음. 100만 문서를 배치 처리하는 데는 안 맞음 — 그건 GPU 일이고, 우리는 아니라고 꾸미지 않습니다. GPU 인스턴스를 제공하지 않습니다. 요금제에 70B 모델이나 무거운 처리량이 필요하면, CPU VPS — 우리 것이든 누구 것이든 — 는 잘못된 도구이고, 한 푼 쓰기 전에 그것을 알아야 합니다.

하지만 당신의 질문에 답하고 결코 집에 전화하지 않는 프라이빗한 7B? 그것은 6 GB 박스에서 편안히 돕니다.

설치 — 세 명령

서버를 띄우고, SSH로 들어가서:

curl -fsSL https://ollama.com/install.sh | sh   # Ollama 설치
ollama run llama3.2:3b                            # 3B 모델을 풀 + 실행

그게 전부입니다 — 터미널에서 채팅하고 있습니다. 자체 코드에서 쓰려면, Ollama가 이미 포트 11434에서 HTTP API를 제공합니다:

curl http://localhost:11434/api/generate -d '{
  "model": "llama3.2:3b",
  "prompt": "Summarize this changelog in two lines: ...",
  "stream": false
}'

미리 알아둘 함정 하나: 기본으로 그 API는 localhost에 바인딩됩니다. 그대로 두고 SSH로 터널하거나, 아니면 인터넷에 노출됩니다. 닿을 수 있게 하고 싶으면 인증 뒤에 두세요 — 공개 IP에 열린 모델 엔드포인트를 남기지 마세요.

박스 고르기

요금제를 모델에 맞추세요, 반대가 아니라:

돌리고 싶은 것필요한 RAM온당한 요금제
3B 모델, 가벼운 사용~3 GBSmall (4 GB)
7B 모델, 편안하게~5-6 GBMedium (6 GB)
더 크게 / 높은 처리량GPU 영역CPU VPS가 아님

대부분의 자체 호스터에게 **Medium (6 GB)**이 솔직한 추천 — 7B 모델과 앱과 OS에 충분한 여유. Small (4 GB)은 3B에 머물면 됩니다. 그 아래는 OS와 컨텍스트가 파고들면 너무 빡빡합니다.

왜 여기서 하나

LLM을 자체 호스팅한다면 프라이버시가 대개 이유의 절반 — 그러니 박스를 빌리려 신분증을 건네는 건 이상합니다. 그럴 필요 없습니다: USDC나 USDT로 낼 수 있고(또는 온램프를 통한 카드), KYC 없이, 서버는 약 1분이면 당신 것입니다. 암호화폐 네이티브, 에이전트 친화, 그리고 데이터는 당신이 통제하는 기기에 남습니다.

트레이드오프는 우리가 솔직했던 그것: CPU 전용, 6 GB 천장, 작은 모델. 그 안에서 자체 호스팅은 훌륭합니다. 그 밖에서는, GPU가 필요한 일에 누군가 당신에게 CPU 박스를 팔게 두지 마세요.

시험할 준비가 됐나요? 요금제를 고르고, 내면, 약 60초 만에 root를 얻습니다 — 그다음 당신만의 프라이빗 모델까지 세 명령입니다.

FAQ

GPU 없이 LLM을 돌릴 수 있나요?

네, 작은 모델은. 4비트 양자화의 3B나 7B 모델은 CPU에서 돌고 읽을 수 있는 속도로 답합니다 — 챗봇, 코딩 도우미, 커서를 지켜보지 않는 백그라운드 작업에는 괜찮습니다. CPU에서 못 하는 것은 큰 모델(13B 이상)을 서빙하거나 높은 처리량을 미는 것; 거기서 GPU가 선택이길 멈춥니다.

Llama 7B에 RAM이 얼마나 필요한가요?

4비트 7B 모델에 컨텍스트 창과 OS를 더하면 약 5 GB — 그래서 6 GB 박스가 편안한 바닥입니다. 3B 모델은 약 3 GB에 들어갑니다. 작은 양자화(Q4)는 약간의 품질을 훨씬 적은 메모리와 맞바꾸고, VPS에서는 알맞은 거래입니다.

LLM 자체 호스팅이 API보다 싼가요?

양에 달렸습니다. 호스팅 API는 토큰당 청구하고 놀 때는 아무것도 안 듭니다; VPS는 쓰든 안 쓰든 정액 월 청구입니다. 꾸준한 요청 흐름을 돌리거나, 주로 프라이버시와 속도 제한 없음을 신경 쓰면 자체 호스팅이 이깁니다. 이따금의 단발 프롬프트에는 계량 API가 쌉니다.

클라우드 API를 쓰는 대신 자체 호스팅하는 이유는?

사람들이 실제로 하는 세 이유: 데이터가 서버를 결코 떠나지 않음(법무, 의료, 또는 그냥 사적 메모에 현실적), 속도 제한이나 토큰당 계량이 없음, 그리고 모델이 당신 밑에서 바뀌거나 폐기되지 않음. 비용은 당신이 박스를 관리하고 그 하드웨어 안에서 사는 것.

CPU VPS에서 현실적으로 돌릴 수 있는 가장 큰 모델은?

6 GB 박스에서 4비트의 7B 모델이 스위트 스폿. 기술적으로는 충분한 RAM으로 13B를 로드할 수 있지만, CPU에서는 느껴질 만큼 느려집니다. 그 너머는 GPU를 원하게 되고, 그것은 다른 종류의 호스트입니다.

댓글

아직 댓글이 없습니다. 첫 번째가 되세요.

댓글 남기기

댓글은 표시되기 전에 검토됩니다.