EQVPS

VPS cho suy luận LLM riêng tư bộ nhớ lớn

Các mô hình lượng tử hóa lớn hơn cần RAM thật, không phải một GPU bạn không có. Nơi một cỗ máy CPU bộ nhớ lớn chạy các mô hình lớp 30B một cách riêng tư, điều gì là thực tế, và nơi nào không. Từ $70/tháng.

Chúng tôi có một trang riêng cho Ollama và các mô hình nhỏ — đó là cỗ máy CPU $12 chạy 1B–8B và embedding. Trang này là đầu kia: các mô hình đủ lớn để RAM, không phải CPU, là cái chặn bạn lại.

Hãy trung thực ngay từ đầu, giống như mọi nơi: máy chủ của chúng tôi chỉ có CPU, không GPU. Một mô hình lớn ở đây chạy chậm. Nếu bạn muốn chat tương tác nhanh trên một mô hình 30B, bạn cần một host GPU — sản phẩm khác, nhà cung cấp khác. Điều một cỗ máy CPU bộ nhớ lớn làm tốt là chạy một mô hình lượng tử hóa lớn một cách riêng tư cho công việc không phải một cửa sổ chat.

Bài toán RAM

Mô hình nằm trong bộ nhớ, lượng tử hóa hay không, cộng chi phí phụ cho ngữ cảnh và runtime:

Đó là vì sao "chạy một mô hình cục bộ lớn hơn" thực ra là một câu hỏi bộ nhớ lớn. Mô hình chính là dấu chân bộ nhớ. Thêm một chỉ mục RAG trên cùng host và các con số chồng lên.

Nơi ưu-tiên-riêng-tư thực sự thắng

Lý do không phải tốc độ và không phải chi phí — mà là một số dữ liệu không thể ra ngoài. Tài liệu pháp lý. Hồ sơ y tế. Mã độc quyền. Bất cứ gì mà gửi prompt tới một API bên thứ ba là không thể. Một mô hình chậm hơn chạy hoàn toàn trên cỗ máy của bạn đánh bại một cái nhanh ghi log mọi thứ bạn gửi nó. Chúng tôi đã viết bức tranh đầy đủ ở đây.

Và nếu dữ liệu nhạy cảm đến vậy, việc thanh toán có lẽ cũng nên riêng tư. Thuê cỗ máy bằng crypto và không KYC giữ cả chuỗi — máy chủ, mô hình, prompt, thanh toán — khỏi hồ sơ danh tính của bất kỳ ai. Đó là điểm bán: không phải suy luận rẻ hơn, mà là suy luận không ai khác thấy được.

Chọn cái gì

Cho một mô hình lớp 30B với chỗ cho ngữ cảnh, Pro-64 (64 GB) là lựa chọn thoải mái; một lượng tử hóa chặt hơn vừa với Pro-32 hoặc Pro-48, một cái lớn hơn đi tới Pro-80. Nạp mô hình trước, xem bộ nhớ thường trú, chọn kích cỡ từ cái bạn đo được. Và đặt kỳ vọng: đây là suy luận theo lô riêng tư, không phải một cửa sổ chat nhanh.

Sẵn sàng triển khai? Thanh toán bằng crypto, không KYC — trực tuyến trong khoảng một phút.

Triển khai ngay →

FAQ

Cái này khác gì với use-case Ollama của bạn?

Trang Ollama nói về các mô hình nhỏ trên một cỗ máy CPU $12 — 1B–8B, embedding, công việc nhẹ. Đây là đầu bộ nhớ lớn: các mô hình lượng tử hóa lớp 13B đến 30B cần 24–48 GB trở lên chỉ để nạp. Cùng thực tế chỉ-CPU, dấu chân bộ nhớ lớn hơn nhiều, gói khác.

Bao nhiêu RAM cho một mô hình cho trước?

Mô hình phải vừa trong bộ nhớ cộng chi phí phụ. Một mô hình 13B 4-bit muốn ~10–16 GB; lớp 30B lượng tử hóa đẩy 24–48 GB; đi lớn hơn hoặc độ chính xác cao hơn và bạn vào 64–80 GB — quá đó, không cỗ máy đơn nào của chúng tôi vừa. Thêm chỗ cho ngữ cảnh bên trên.

Nó có nhanh không?

Không — hãy trung thực với bản thân ở đây. Suy luận CPU trên một mô hình lớn là vài token mỗi giây, không phải một luồng tương tác. Nó ổn cho công việc theo lô và nền (tóm tắt qua đêm, phân loại một hàng đợi). Cho chat thời gian thực trên một mô hình lớn bạn cần một GPU, thứ chúng tôi không cung cấp.

Vì sao chạy nó ở đây thay vì một API?

Quyền riêng tư. Prompt và output của bạn không bao giờ chạm vào máy chủ hay log của một nhà cung cấp. Với dữ liệu nhạy cảm — pháp lý, y tế, mã nội bộ — một mô hình riêng tư chậm hơn đánh bại một cái nhanh thấy mọi thứ. Ghép nó với thanh toán crypto không KYC và cả chuỗi vẫn là của bạn.

Bình luận

Chưa có bình luận nào. Hãy là người đầu tiên.

Để lại bình luận

Bình luận được kiểm duyệt trước khi hiển thị.