우리에게는 Ollama와 작은 모델을 위한 별도 페이지가 있습니다 — 그것이 $12 CPU 박스로 1B–8B와 임베딩을 돌리는 것. 이 페이지는 반대쪽: CPU가 아니라 RAM이 당신을 멈추게 할 만큼 큰 모델입니다.
먼저 솔직하게, 어디서나 같이: 우리 서버는 CPU 전용, GPU 없음. 큰 모델은 여기서 느리게 돕니다. 30B 모델에서 빠른 대화식 채팅을 원하면 GPU 호스트가 필요합니다 — 다른 제품, 다른 제공자. 고메모리 CPU 박스가 잘하는 것은 채팅 창이 아닌 작업을 위해 큰 양자화 모델을 프라이빗하게 돌리는 것입니다.
RAM 계산
모델은 양자화됐든 아니든 메모리에 앉고, 더해 컨텍스트와 런타임의 오버헤드:
- 13B, 4비트 — 대략 10–16 GB. 이미 중간 요금제에서 돕니다.
- 30B급, 양자화 — 양자화에 따라 24–48 GB. 이것이 Pro-32에서 Pro-64 영역.
- 더 크거나 더 높은 정밀도 — 64–80 GB, 80 GB를 넘으면 우리 어떤 단일 박스도 안 맞습니다. Pro-80이 여기의 천장.
그래서 "더 큰 로컬 모델을 돌리기"가 정말 고메모리 질문입니다. 모델이 메모리 풋프린트. 같은 호스트에 RAG 인덱스를 더하면 숫자가 쌓입니다.
프라이버시 우선이 진정으로 이기는 곳
논거는 속도도 비용도 아니라 — 어떤 데이터는 떠날 수 없다는 것입니다. 법무 문서. 의료 기록. 독점 코드. 프롬프트를 제3자 API로 보내는 것이 논외인 무엇이든. 전적으로 당신의 기기에서 도는 느린 모델이, 당신이 보내는 모든 것을 로그하는 빠른 것을 이깁니다. 우리는 여기서 전체 그림을 썼습니다.
그리고 데이터가 그만큼 민감하면, 결제도 아마 프라이빗해야 합니다. 박스를 암호화폐와 KYC 없이 빌리는 것이 사슬 전체 — 서버, 모델, 프롬프트, 청구 — 를 누구의 신원 기록에서도 떨어뜨려 둡니다. 그것이 요지입니다: 더 싼 추론이 아니라 아무도 볼 수 없는 추론.
무엇을 고를까
컨텍스트 여지가 있는 30B급 모델에는 Pro-64(64 GB)가 편안한 선택; 빡빡한 양자화는 Pro-32나 Pro-48에 맞고, 더 큰 것은 Pro-80으로. 먼저 모델을 로드하고, 상주 메모리를 보고, 측정한 값에서 크기를 잡으세요. 그리고 기대를 설정: 이것은 프라이빗 배치 추론이지 빠른 채팅 창이 아닙니다.
댓글
아직 댓글이 없습니다. 첫 번째가 되세요.