เอเจนต์ที่เขียนโค้ดได้ สุดท้ายก็ต้องรันมัน นั่นคือเหตุผลที่เอเจนต์แบบนี้มีอยู่ — และก็เป็นส่วนที่ชวนกังวลด้วย โมเดลเพิ่งสร้างสคริปต์ที่ตัวมันเองไม่เคยรัน มันติดตั้งแพ็กเกจที่ไม่มีใครตรวจ และแตะไฟล์ที่ไม่มีใครระบุไว้ การรันมันข้าง ๆ คีย์ SSH และไฟล์ .env ของระบบจริง คือการเดิมพันที่คุณทำหลายครั้งต่อวัน
แซนด์บ็อกซ์ทำให้การเดิมพันนั้นถูกลง โค้ดได้เครื่อง Linux ของตัวเองไม่กี่วินาทีหรือไม่กี่นาที แล้วเครื่องก็หายไป
เอเจนต์ได้อะไร
แซนด์บ็อกซ์แต่ละตัวคือ Firecracker microVM มีเคอร์เนลของตัวเอง ระบบไฟล์ของตัวเอง และเนมสเปซเครือข่ายของตัวเอง ไม่ใช่คอนเทนเนอร์ที่ใช้เคอร์เนลร่วมกับคุณ และไม่ใช่โฟลเดอร์บนเซิร์ฟเวอร์ของคุณ มันเปิดได้ในราวหนึ่งวินาที ซึ่งสำคัญมากเมื่อเอเจนต์เปิดหนึ่งตัวต่องาน ไม่ใช่วันละตัว
ข้างในมี Python 3.12 พร้อม pip, Node.js 22 พร้อม npm, bash, git และ curl อินเทอร์เน็ตขาออกใช้ได้ — เอเจนต์รัน pip install pandas หรือ clone รีโพได้ ขาเข้าไม่ได้: ไม่มีพอร์ตเปิด ไม่มี SSH คำสั่ง ไฟล์ และเอาต์พุตทั้งหมดผ่าน API ของเรา และนั่นคือประตูบานเดียว
เข้าใช้งานได้สามทาง:
- MCP — ถ้าเอเจนต์ของคุณอยู่ใน Claude, Cursor, Cline หรือไคลเอนต์อื่นที่รองรับ MCP มันจะเห็นเครื่องมือแซนด์บ็อกซ์ข้างเครื่องมือ VPS โดยคุณไม่ต้องเขียนโค้ด
- SDK สำหรับ Python หรือ TypeScript —
pip install eqvpsหรือnpm i @eqvps/sdkแล้วสร้าง รัน ลบ - REST ล้วน — อธิบายไว้ใน เอกสารแซนด์บ็อกซ์ และสเปก OpenAPI
ลูปที่เล็กที่สุดใน Python หน้าตาแบบนี้:
from eqvps import Sandbox
with Sandbox.create(tariff="small") as sb:
sb.upload("/root/task.py", agent_generated_code)
result = sb.exec("python3 /root/task.py", timeout=55)
print(result.exit_code, result.stdout[-2000:])
# the sandbox is deleted here, also if anything above raised
exit code ที่ไม่ใช่ศูนย์จะกลับมาเป็นผลลัพธ์ปกติ ไม่ใช่ exception ซึ่งตรงกับที่ต้องการเมื่อเอเจนต์ต้องอ่าน traceback แล้วลองใหม่
กรณีอันตราย และสิ่งที่เกิดขึ้นกับมัน
แพ็กเกจประสงค์ร้าย หรือแค่พัง มันรันใน VM ที่ไม่มีอะไรของคุณอยู่เลย ลบแซนด์บ็อกซ์ มันก็หายไป
ความลับ อย่าใส่ API key หลักของคุณในโค้ดที่เอเจนต์เขียน ถ้างานไหนจำเป็นต้องใช้คีย์จริง ๆ ให้ส่งเป็นตัวแปรสภาพแวดล้อมของแซนด์บ็อกซ์ ค่าจะถูกเก็บแบบเข้ารหัส ไม่ถูกบันทึกลง log และ API คืนให้แค่ชื่อตัวแปร
ลูปไม่รู้จบ ทุกคำสั่งหยุดเมื่อครบ 55 วินาที เว้นแต่คุณเริ่มมันเป็นงานเบื้องหลัง แซนด์บ็อกซ์ชั่วคราวที่ไม่มีงานจะลบตัวเองหลังหมดเวลา idle (ค่าเริ่มต้น 5 นาที) และเพดานค่าใช้จ่ายรายวันหรือรายเดือนจะหยุดการสร้างแซนด์บ็อกซ์ใหม่เมื่อเอเจนต์ใช้เงินพอแล้วสำหรับวันนั้น
ข้อมูลรั่วออกไป ตรงนี้ต้องพูดกันตรง ๆ: อินเทอร์เน็ตขาออกเปิดอยู่ เพราะถ้าไม่มี pip install ก็ใช้ไม่ได้ แซนด์บ็อกซ์ปกป้องเครื่องของคุณ แต่ไม่ได้ห้ามโค้ดส่งทุกอย่างที่อ่านได้ในแซนด์บ็อกซ์ออกไปยังอินเทอร์เน็ต กฎจึงง่ายมาก: ใส่ในแซนด์บ็อกซ์เฉพาะสิ่งที่เสียไปก็ไม่เป็นไร
เลือกแพ็กเกจ
| แพ็กเกจ | vCPU / RAM | ต่อชั่วโมง | เหมาะกับ |
|---|---|---|---|
| micro | 0.25 / 512 MB | $0.0165 | สคริปต์ครั้งเดียว ตรวจข้อมูล |
| small | 0.5 / 1 GB | $0.033 | โค้ดเอเจนต์ส่วนใหญ่ pip install |
| standard | 1 / 2 GB | $0.066 | pandas ชุดทดสอบ |
| plus | 2 / 4 GB | $0.132 | ติดตั้งของหนัก (torch) งาน build |
คิดเงินรายวินาที ขั้นต่ำ 60 วินาที จากยอดเงินเติมล่วงหน้าเดียวกับ VPS ของเรา งานเอเจนต์ทั่วไป — สร้าง ติดตั้งสองแพ็กเกจ รัน ลบ — ใช้เวลาไม่ถึงนาทีบน small จึงคิดขั้นต่ำ 60 วินาที: ประมาณ $0.0006 พูดตามตรง สำหรับเอเจนต์ที่รันโค้ดวันละหลายร้อยครั้ง ค่าแซนด์บ็อกซ์คือบรรทัดที่เล็กที่สุดในงบ ค่า token ของ LLM แพงกว่ามาก
เมื่อไรที่แซนด์บ็อกซ์ไม่ใช่เครื่องมือที่ใช่
ถ้าเอเจนต์ต้องให้บริการอะไรสักอย่าง — เว็บแอป ตัวรับ webhook บอทที่รอฟังข้อความ — แซนด์บ็อกซ์ไม่เหมาะ เพราะจากภายนอกเข้าถึงมันไม่ได้ บริการที่ต้องรันต่อเนื่องเป็นเดือนก็เช่นกัน นั่นเป็นงานของ VPS: ดู VPS สำหรับเอเจนต์ AI การแบ่งงานที่พบบ่อยคือ เอเจนต์อยู่บน VPS เล็ก ๆ แล้วสร้างแซนด์บ็อกซ์ให้โค้ดทุกชิ้นที่ไม่เคยเห็นมาก่อน
ข้อจำกัดอีกข้อคืองานคำนวณหนักต่อเนื่อง แซนด์บ็อกซ์ที่ใช้ CPU เต็มที่นานเกิน 15 นาทีถือว่าใช้งานผิดวัตถุประสงค์ งานคำนวณยาว ๆ จึงควรอยู่บนเซิร์ฟเวอร์ที่เช่ารายเดือน
เริ่มต้น
สมัครบัญชี รับ token แล้วรันแซนด์บ็อกซ์แรก — คู่มือการเชื่อมต่อ พาไปทีละขั้น และบัญชีใหม่ได้เวลาแซนด์บ็อกซ์มูลค่า $1 ไว้ทดลอง จากนั้นชี้เอเจนต์ไปที่ หน้าแซนด์บ็อกซ์ หรือเครื่องมือ MCP แล้วปล่อยให้มันพังของในที่ที่การพังไม่มีค่าใช้จ่าย
ทีละขั้นตอน: งานแรกของเอเจนต์ในแซนด์บ็อกซ์. ที่เกี่ยวข้อง: รันเทสต์ CI แบบแยกขาด, การประเมิน LLM และ รีวิวโค้ดและตรวจ PR.
ความคิดเห็น
ยังไม่มีความคิดเห็น เป็นคนแรกสิ