−25%

cho Windows trả theo năm, đến 31/10. Xem các gói

EQVPS

VPS cần bao nhiêu RAM? Con số thực tế theo từng tác vụ

26 thg 9, 2026 · 4 phút đọc · EQVPS Team

Phần lớn mọi người đoán mò dung lượng RAM. Họ hoặc mua quá nhiều “cho chắc”, hoặc làm quen với OOM killer lúc 3 giờ sáng. Bộ nhớ thực ra là một trong những thứ dễ chọn cấu hình nhất, vì tác vụ có thể dự đoán được khi bạn biết các con số ước chừng. Đây là chúng, từ máy 1 GB cho bot tới những máy chủ 64 GB mà người ta tìm khi muốn chạy mô hình lớn tại chỗ.

Con số ước chừng theo tác vụ

Đây là giá trị thực tế ở trạng thái ổn định cho một cấu hình điển hình, không phải mức tối thiểu của nhà cung cấp phần mềm.

Tác vụRAM thực sự dùngGói phù hợp
Bot Telegram/Discord (Python, Node.js)100–300 MBNano 1 GB
Trang tĩnh + Caddy/Nginx50–150 MBNano 1 GB
WordPress + MariaDB, lưu lượng bình thường0,8–1,5 GBMicro-IP 2 GB
PostgreSQL cho ứng dụng nhỏ0,5–2 GB (bạn quyết định qua shared_buffers)Micro / Small
n8n với vài workflow0,5–1,5 GBMicro 2 GB
Máy chủ Docker với 5–10 dịch vụ nhỏ2–4 GBSmall 4 GB
Coolify + build + một cơ sở dữ liệu3–4 GBSmall-IP 4 GB
LLM 7–8B, 4-bit, suy luận trên CPU5–6 GBMedium 6 GB
LLM 14B, 4-bit~10 GBPro-32
LLM 32B, 4-bit~20 GBPro-32
LLM 70B, 4-bit~40–45 GBPro-48 / Pro-64

Có hai điều đáng chú ý. Thứ nhất, khoảng cách giữa các tác vụ “bình thường” và LLM là rất lớn: một bot và một mô hình 70B chênh nhau tới hai trăm lần. Thứ hai, hầu hết dịch vụ chạy tốt với 1–4 GB; người ta mua thừa vì chọn cấu hình cho một tương lai hiếm khi tới.

Công thức cho LLM

Với mô hình ngôn ngữ có một cách ước tính đơn giản: số tham số × số bit mỗi trọng số ÷ 8, cộng phần phụ trội. Một mô hình 8B ở khoảng 4,5 bit (mức lượng tử hóa Q4 điển hình) là 8 × 4,5 ÷ 8 ≈ 4,5 GB trọng số. Cộng thêm 1–2 GB cho cửa sổ ngữ cảnh (KV cache tăng theo độ dài ngữ cảnh) và runtime, bạn sẽ có 5–6 GB.

Phần thật lòng: trên máy chủ chỉ có CPU, bộ nhớ mới là một nửa câu chuyện. Hãy kỳ vọng vài token mỗi giây với mô hình 7–8B trên vài vCPU và khoảng một token mỗi giây với 70B. Như vậy ổn cho tác vụ theo lô, agent chạy nền và thử nghiệm riêng; đó không phải trải nghiệm trò chuyện cho nhiều người dùng cùng lúc. Nếu bạn chủ yếu gọi API của các mô hình được lưu trữ sẵn, agent của bạn cần ít hơn nhiều: xem chọn cấu hình VPS cho agent AI.

Hãy đo thay vì đoán

Nếu bạn đã có máy chủ, con số nằm ngay đó:

free -h                              # look at "available", not "free"
ps aux --sort=-rss | head -n 8       # the biggest processes, by resident memory
docker stats --no-stream             # per-container usage

Linux dùng RAM nhàn rỗi làm bộ đệm đĩa, nên “free” luôn nhỏ, và đó là điều lành mạnh. Available mới là con số quan trọng: bộ nhớ mà kernel có thể cấp cho chương trình ngay lúc này. Nếu available luôn trên ~25% vào giờ cao điểm, cấu hình của bạn đã hợp lý. Nếu nó thường xuyên chạm 0 và swap tăng lên, hãy nâng gói.

Kiểm tra cả các lần bị OOM kill trong quá khứ:

journalctl -k | grep -i "out of memory"

Swap: dây an toàn, không phải động cơ

Một tệp swap 1–2 GB trên máy chủ nhỏ là bảo hiểm giá rẻ: một lần cập nhật gói hay build Docker cần thêm bộ nhớ trong chốc lát sẽ sống sót thay vì bị buộc dừng. Nhưng nếu một dịch vụ sống trong swap, mọi yêu cầu đều phải chờ đĩa. Swap dành cho các đợt tăng đột biến. Swap liên tục nghĩa là bạn cần gói tiếp theo.

Vậy nên mua bao nhiêu?

Hãy bắt đầu nhỏ hơn một cỡ so với trực giác, theo dõi free -h trong một tuần, rồi nâng cấp nếu con số cho thấy cần. Tại EQVPS, nâng gói vẫn giữ nguyên dữ liệu và chỉ tính phần chênh lệch theo tỷ lệ (cách đổi gói hoạt động).

FAQ

Một VPS cơ bản cần bao nhiêu RAM?

Với một bot, một API nhỏ hoặc một trang tĩnh, 1 GB là đủ, thường còn dư. 2 GB là mức mặc định thoải mái khi bạn thêm cơ sở dữ liệu hoặc chạy mọi thứ trong Docker. Dưới 1 GB, các trình quản lý gói và runtime ngôn ngữ hiện đại bắt đầu chật vật.

Tôi cần bao nhiêu RAM để chạy LLM trên VPS?

Khoảng bằng kích thước mô hình ở mức lượng tử hóa của nó, cộng thêm một hai gigabyte cho ngữ cảnh. Mô hình 7–8B ở 4-bit cần khoảng 5–6 GB, 14B khoảng 10 GB, 32B khoảng 20 GB và 70B khoảng 40–45 GB. Đó là lý do có máy chủ 64 GB: vừa chứa mô hình 70B mà vẫn còn chỗ cho phần còn lại của hệ thống.

Swap có thay thế được RAM không?

Không. Swap là lưới an toàn cho các đợt tăng ngắn: nó giúp một bản build hay bản sao lưu không bị buộc dừng. Nếu một tác vụ sống trong swap cả ngày, mọi thứ sẽ chậm; đó là dấu hiệu nên nâng gói.

Làm sao biết máy chủ của tôi thực sự dùng bao nhiêu RAM?

Chạy 'free -h' và nhìn cột 'available', không phải 'free': Linux dùng bộ nhớ trống làm bộ đệm đĩa và trả lại khi cần. 'ps aux --sort=-rss | head' hiển thị các tiến trình lớn nhất, còn 'docker stats --no-stream' hiển thị mức dùng theo từng container.

Khi nào một VPS 64 GB là hợp lý?

Khi có một thứ phải nằm trong bộ nhớ: mô hình cục bộ 32–70B, chỉ mục vector lớn cho RAG, hoặc một đội agent với runtime riêng. Với website, bot và hầu hết API, đó là lãng phí tiền.

← Quay lại blogXem gói & giá →

Bình luận

Chưa có bình luận nào. Hãy là người đầu tiên.

Để lại bình luận

Bình luận được kiểm duyệt trước khi hiển thị.