Câu trả lời trung thực cho "agent AI của tôi cần bao nhiêu máy chủ?" là: ít hơn bạn nghĩ — cho tới đúng lúc đột nhiên không phải vậy. Mẹo là biết khối lượng công việc của bạn ngồi ở phía nào của cái ranh giới đó. Nên thay vì đoán, đây là cái mỗi loại agent thực sự dùng.
Một câu hỏi quyết định mọi thứ
Mô hình chạy trên máy chủ của bạn, hay agent của bạn gọi một mô hình qua một API?
Nếu agent của bạn nói chuyện với một LLM được host (trường hợp phổ biến), phần thông minh, đắt tiền diễn ra trên phần cứng của người khác. Cỗ máy của bạn chỉ chạy một vòng lặp điều phối: nhận đầu vào, gọi API, parse kết quả, có thể chạm một cơ sở dữ liệu, lặp lại. Đó là nhẹ. Thực sự nhẹ — một cỗ máy 1 GB làm nó mà không đổ mồ hôi.
Nếu bạn chạy mô hình cục bộ, mọi thứ thay đổi: giờ RAM bị chi phối bởi trọng số mô hình, và bạn sẽ muốn mọi lõi bạn có thể có. Hầu hết mọi người không cần điều này. Những người cần thường biết chính xác vì sao (quyền riêng tư, không giới hạn tần suất, offline). Nếu đó là bạn, chúng tôi đã viết một hướng dẫn riêng về tự host một LLM cục bộ.
Chọn kích cỡ theo khối lượng công việc
Các con số thực, loại bạn có thể hành động dựa trên:
| Khối lượng công việc | RAM | vCPU | Đĩa | Ghi chú |
|---|---|---|---|---|
| Agent chat / trợ lý (dựa trên API) | 1 GB | 2 | 15 GB | Vòng lặp tí hon; mô hình ở xa |
| Scraper / agent dữ liệu | 2 GB | 2 | 25 GB | Dư địa cho parse + dữ liệu scrape |
| Bot giao dịch | 1–2 GB | 2 | 15–25 GB | Độ trễ quan trọng hơn kích cỡ — xem hướng dẫn bot giao dịch |
| Vài agent song song | 4 GB | 4 | 35 GB | Mỗi agent rẻ; đồng thời cộng dồn lại |
| LLM cục bộ, 3B–7B (lượng tử hóa) | 4–6 GB | 4–6 | 25–45 GB | Chỉ-CPU, chạy ở tốc độ đọc được, không phải hàng loạt |
Mẫu: các agent dựa trên API tí hon; các mô hình cục bộ là thứ duy nhất nặng.
Nơi một cỗ máy CPU ngừng
Nói thẳng về trần: các gói của chúng tôi đạt đỉnh ở 6 GB RAM và 6 lõi, chỉ-CPU — không GPU. Điều đó bao phủ mọi thứ trong bảng trên, kể cả một mô hình cục bộ 7B cho dùng cá nhân. Điều nó không bao phủ: các mô hình 13B+, suy luận cục bộ thông lượng cao, hoặc bất cứ gì thực sự cần một GPU. Nếu đó là khối lượng công việc của bạn, một VPS CPU — của chúng tôi hay của bất kỳ ai — là công cụ sai, và tốt hơn biết điều đó bây giờ hơn là sau khi bạn đã triển khai.
Cho 95% các agent gọi một API, không điều nào trong đây là vấn đề. Chúng hạnh phúc trên cỗ máy nhỏ nhất.
Một quy tắc ngón tay cái thực tế
- Chỉ một agent gọi một API? Bắt đầu ở 1 GB / 2 lõi. Bạn có thể đổi kích cỡ sau.
- Scraping hoặc lưu dữ liệu? 2 GB và một đĩa lớn hơn.
- Chạy vài agent, hoặc một mô hình cục bộ nhỏ? 4–6 GB và 4+ lõi.
- Cần một GPU? Nhóm khác — đừng ép nó lên CPU.
Đừng cấp thừa vì lo lắng. Các agent nhẹ về bản chất; chi phí của một cỗ máy quá nhỏ là một lần đổi kích cỡ, trong khi chi phí của một cỗ máy quá lớn là trả tiền cho RAM nhàn rỗi mỗi tháng.
Khi bạn đã chọn một kích cỡ, một agent có thể tự thuê cỗ máy qua MCP, hoặc bạn có thể đặt nó trong một phút trên trang. Dù cách nào, bắt đầu nhỏ — bạn gần như chắc chắn sẽ cần ít hơn bạn trông đợi.
Bình luận
Chưa có bình luận nào. Hãy là người đầu tiên.