Hãy trung thực ngay từ đầu: nếu bạn muốn sinh nhanh, rẻ, chất lượng cao, hãy gọi một API. Một VPS CPU sẽ không đánh bại một datacenter đầy GPU, và bất kỳ ai nói bạn khác đi đang bán một thứ gì đó.
Vậy sao lại tự host suy luận chút nào? Một lý do, và nó là một lý do tốt: mô hình trên máy chủ của bạn không bao giờ gửi các prompt của bạn đi đâu cả.
Suy luận CPU thực sự trông thế nào
Bạn có thể chạy các mô hình thật trên CPU với đủ RAM. Một mô hình 7–8B lượng tử hóa xuống 4-bit hoạt động. Một 13B hoạt động. Bạn thậm chí có thể đẩy một mô hình lớp 30B nếu bạn có bộ nhớ. Cái bạn không thể làm là làm cho nó nhanh — đầu ra đến với vài token mỗi giây, không phải luồng tức thì một API cho bạn.
Đó là đánh đổi trung thực. Cho chat tương tác nó bực bội. Cho công việc nền — tóm tắt tài liệu qua đêm, phân loại một hàng đợi, làm giàu dữ liệu theo lịch — vài token mỗi giây hoàn toàn ổn, và không ai canh đồng hồ.
Bài toán RAM
Mô hình phải nằm trong bộ nhớ, lượng tử hóa hay không, cộng chi phí phụ cho ngữ cảnh và runtime:
- 7–8B, 4-bit — khoảng 6–8 GB. Chạy trên một gói tầm trung.
- 13B, 4-bit — khoảng 10–16 GB.
- Lớp 30B, lượng tử hóa — 24–48 GB, tùy lượng tử hóa.
- Lớn hơn, hoặc độ chính xác cao hơn — bạn vào 64–80 GB nhanh — và quá 80 GB không cỗ máy Pro đơn nào vừa, vẫn chậm-CPU.
Đó là vì sao "chạy một mô hình cục bộ" lặng lẽ trở thành một câu hỏi bộ nhớ lớn. Mô hình chính là dấu chân bộ nhớ. Thêm một chỉ mục RAG hoặc các agent trên cùng cỗ máy và các con số chồng lên.
Ollama so với vLLM, ngắn gọn
Ollama là cánh cửa dễ vào — cài, ollama run, xong. Nó là công cụ đúng cho một thiết lập một-người-dùng riêng tư nơi bạn chỉ muốn mô hình khả dụng. vLLM được xây dựng cho thông lượng phục vụ: nhiều thiết lập hơn, tốt hơn dưới tải đồng thời, đáng khi bạn thực sự xử lý khối lượng lớn. Bắt đầu với Ollama; với tới vLLM khi bạn phục vụ lưu lượng thật.
Nơi ưu-tiên-riêng-tư thực sự thắng
Lý do cho suy luận tự host không phải tốc độ hay chi phí — mà là một số dữ liệu không thể ra ngoài. Tài liệu pháp lý. Hồ sơ y tế. Mã độc quyền. Bất cứ gì mà gửi prompt tới một API bên thứ ba là không thể vì lý do chính sách hoặc tin tưởng. Một mô hình chậm hơn chạy hoàn toàn trên cỗ máy của bạn đánh bại một cái nhanh ghi log mọi thứ bạn gửi nó.
Và nếu dữ liệu nhạy cảm đến vậy, việc thanh toán có lẽ cũng nên riêng tư. Thuê cỗ máy bằng crypto và không KYC giữ cả chuỗi — máy chủ, mô hình, prompt, thanh toán — khỏi hồ sơ danh tính của bất kỳ ai. Đó là điểm bán thật sự: không phải "suy luận rẻ hơn," mà "suy luận không ai khác thấy được."
Kết luận
Cho tốc độ và chất lượng, dùng một API — không có gì xấu hổ. Tự host khi quyền riêng tư là yêu cầu và chậm hơn là chấp nhận được. Chọn kích cỡ cho mô hình cộng ngữ cảnh của nó cộng bất cứ gì khác chia sẻ cỗ máy, và đừng trông đợi tốc độ GPU từ CPU.
Khi mô hình cần bộ nhớ thật, dòng Pro chạy 32 đến 80 GB với một IP riêng và sao lưu hàng đêm — đủ để giữ một mô hình lượng tử hóa nghiêm túc với chỗ cho ngữ cảnh quanh nó.
Bình luận
Chưa có bình luận nào. Hãy là người đầu tiên.