먼저 솔직하게: 빠르고, 싸고, 고품질 생성을 원하면 API를 부르세요. CPU VPS는 GPU로 가득한 데이터센터를 이길 수 없고, 아니라고 말하는 누구든 무언가를 팔고 있습니다.
그럼 왜 추론을 자체 호스팅하나? 이유 하나, 그리고 좋은 것: 당신 서버의 모델은 당신의 프롬프트를 어디에도 보내지 않습니다.
CPU 추론은 실제로 어떻게 보이는가
충분한 RAM이 있으면 CPU에서 진짜 모델을 돌릴 수 있습니다. 4비트로 양자화된 7~8B 모델은 됩니다. 13B도 됩니다. 메모리가 있으면 30B급 모델도 밀 수 있습니다. 할 수 없는 것은 그것을 빠르게 만드는 것 — 출력은 초당 몇 토큰으로 오지, API가 주는 즉각적 스트림이 아닙니다.
그것이 솔직한 거래입니다. 대화식 채팅에는 답답합니다. 백그라운드 작업에는 — 밤새 문서를 요약하고, 큐를 분류하고, 스케줄로 데이터를 풍부하게 하고 — 초당 몇 토큰이면 완전히 괜찮고, 아무도 시계를 보지 않습니다.
RAM 계산
모델은 양자화됐든 아니든 메모리에 앉아야 하고, 더해 컨텍스트와 런타임의 오버헤드:
- 7~8B, 4비트 — 약 6~8 GB. 중간 요금제에서 돕니다.
- 13B, 4비트 — 대략 10~16 GB.
- 30B급, 양자화 — 양자화에 따라 24~48 GB.
- 더 크거나 더 높은 정밀도 — 빠르게 64~80 GB로 들어가고 — 80 GB를 넘으면 어떤 단일 Pro 박스도 안 맞고, 여전히 CPU로 느립니다.
그래서 "로컬 모델을 돌리기"가 조용히 고메모리 질문이 됩니다. 모델이 메모리 풋프린트입니다. 같은 박스에 RAG 인덱스나 에이전트를 더하면 숫자가 쌓입니다.
Ollama 대 vLLM, 간략히
Ollama는 쉬운 문 — 설치하고, ollama run, 끝. 그냥 모델이 이용 가능하면 되는 프라이빗한 단일 사용자 설정에 알맞은 도구입니다. vLLM은 서빙 처리량을 위한 것: 더 많은 설정, 동시 부하에서 우수, 실제로 양을 처리할 때 값어치가 있습니다. Ollama로 시작하고; 진짜 트래픽을 서빙할 때 vLLM으로 손을 뻗으세요.
프라이버시 우선이 진정으로 이기는 곳
자체 호스팅 추론의 논거는 속도나 비용이 아니라 — 어떤 데이터는 떠날 수 없다는 것입니다. 법무 문서. 의료 기록. 독점 코드. 프롬프트를 제3자 API로 보내는 것이 정책이나 신뢰의 이유로 논외인 무엇이든. 전적으로 당신의 기기에서 도는 느린 모델이, 당신이 보내는 모든 것을 로그하는 빠른 것을 이깁니다.
그리고 데이터가 그만큼 민감하면, 결제도 아마 프라이빗해야 합니다. 박스를 암호화폐와 KYC 없이 빌리는 것이 사슬 전체 — 서버, 모델, 프롬프트, 청구 — 를 누구의 신원 기록에서도 떨어뜨려 둡니다. 그것이 실제 요지입니다: "더 싼 추론"이 아니라 "아무도 볼 수 없는 추론".
결론
속도와 품질에는 API를 쓰세요 — 부끄러울 것 없습니다. 프라이버시가 요건이고 느린 게 받아들여질 때 자체 호스팅하세요. 모델과 그 컨텍스트와 박스를 공유하는 다른 것에 맞춰 크기를 잡고, CPU에서 GPU 속도를 기대하지 마세요.
모델이 진짜 메모리를 필요로 할 때, Pro 라인은 전용 IP와 야간 백업으로 32에서 80 GB를 돌립니다 — 진지한 양자화 모델을 주변에 컨텍스트 여지를 두고 쥐기에 충분합니다.
댓글
아직 댓글이 없습니다. 첫 번째가 되세요.