Ollama는 로컬 모델 실행을 한 줄 설치로 만듭니다. 이것은 실행 가이드입니다. CPU 추론이 할 수 있는 것과 없는 것(그리고 RAG의 최적점)에 대한 솔직한 그림은 Ollama용 VPS 사용 사례와 Ollama 자체 호스팅을 보세요.
1. Ollama 설치
curl -fsSL https://ollama.com/install.sh | sh
이것은 Ollama를 설치하고 localhost:11434에서 수신하는 systemd 서비스로 시작합니다.
2. 작은 모델을 받아 실행하기
CPU 머신에서는 작게 시작하세요:
ollama pull llama3.2:3b
ollama run llama3.2:3b "Summarize this in one sentence: ..."
3B 모델은 CPU에서 정말 쓸 만합니다. 7–8B는 초당 몇 토큰으로 돌아갑니다(배치엔 괜찮지만 채팅엔 고통). 13B+는 스왑하며 기어갑니다 — 하지 마세요.
3. HTTP API 호출
curl http://localhost:11434/api/generate \
-d '{"model":"llama3.2:3b","prompt":"ping","stream":false}'
임베딩이 CPU의 최적점입니다:
ollama pull nomic-embed-text
curl http://localhost:11434/api/embeddings \
-d '{"model":"nomic-embed-text","prompt":"hello world"}'
4. localhost에 두기 — 필요하면 안전하게 노출
Ollama는 기본적으로 127.0.0.1:11434에 바인딩됩니다. 그대로 두세요. 다른 머신에서 접근해야 한다면 전용 IP 요금제에서 인증이 있는 리버스 프록시를 앞에 두거나(nginx + HTTPS 가이드) SSH 터널을 사용하세요 — 인증 없는 모델 엔드포인트를 절대 공개적으로 노출하지 마세요.
솔직한 부분
이것들은 CPU 전용 인스턴스입니다(GPU 없음). 작은 양자화 모델과 임베딩은 잘 돌아갑니다. 큰 모델은 아닙니다. Ollama를 비공개 RAG 스택용 벡터 DB와 짝지으세요 — 작은 로컬 임베딩에 로컬 벡터 스토어가 여기서 진짜 빛나는 구성입니다. **Medium(월 $12, 6 GB)**이 편안한 요금제입니다. 약 1분이면 root, KYC 없음, 암호화폐로 결제.
댓글
아직 댓글이 없습니다. 첫 번째가 되세요.