Tool / VRAM calculator
รันโมเดลอะไรได้บ้าง? เครื่องคำนวณ
คำนวณ VRAM ที่ต้องใช้ เลือกโมเดล Qwen, Llama, DeepSeek, gpt-oss ระดับ quantization ความยาว context และจำนวนผู้ใช้ แล้วดูว่าต้องใช้กี่ GB และรุ่นไหนพอ
ใส่โมเดลที่อยากรัน ระดับ quantization ความยาว context และจำนวนคนที่ใช้พร้อมกัน แล้วเครื่องคำนวณจะบอกว่าต้องใช้หน่วยความจำกี่ GB และเครื่องรุ่นไหนพอ ทุกตัวเลขคำนวณจากสเปกที่ผู้พัฒนาโมเดลเผยแพร่ ไม่ใช่ผลทดสอบของเรา และคำนวณในเบราว์เซอร์ของคุณเองโดยไม่ส่งข้อมูลกลับมา
Estimated memory
≈27.9GB
- Weights
- 20.0
- KV cache
- 6.4
- Runtime
- 1.5
- แนะนำ
DGX Spark-class128 GB unified LPDDR5x
- พอดี
RTX 5090 single-GPU32 GB GDDR7
- พอดี
RTX PRO 6000 Blackwell96 GB GDDR7 ECC
- พอดี
Multi-GPU tower64 ถึง 384 GB รวม (2x 5090 ถึง 4x PRO 6000)
- พอดี
Mac Studio36 ถึง 512 GB unified
ตัวเลขเหล่านี้คำนวณอย่างไร
ทุกอย่างในเครื่องคำนวณนี้เป็นเลขคณิตธรรมดาบนตัวเลขที่ผู้พัฒนาโมเดลเผยแพร่ ไม่มีค่าที่วัดจากเครื่องของเรา จึงตรวจสอบย้อนกลับได้ทุกบรรทัด
1. น้ำหนักโมเดล (weights)
จำนวนพารามิเตอร์ (หน่วยพันล้าน) คูณ byte ต่อพารามิเตอร์ตามระดับ quantization แล้วบวกอีก 5% สำหรับ embedding, normalization และ scale ของการ quantize ตัวอย่าง: Qwen3 32B ที่ Q4_K_M ใช้ประมาณ 32.8 × 0.58 × 1.05 ≈ 20 GB
2. KV cache
ทุก token ในบทสนทนาที่เปิดอยู่ต้องเก็บค่า key และ value ของทุกชั้น: 2 × จำนวนชั้น × จำนวน KV head × ขนาด head × byte ต่อค่า เราใช้ค่า 8-bit เพราะ vLLM และ llama.cpp ที่เราติดตั้งเก็บ cache แบบนี้อยู่แล้ว จากนั้นคูณด้วยความยาว context และจำนวนคนที่ใช้พร้อมกัน นี่คือส่วนที่โตเร็วที่สุดเมื่อทีมใหญ่ขึ้น
3. Runtime
CUDA context, activation ระหว่างคำนวณ และบัฟเฟอร์ของเซิร์ฟเวอร์ ราว 1.5 GB คงที่ต่อโมเดลที่โหลด
4. เกณฑ์ “พอดี”
เราไม่วางแผนใช้หน่วยความจำเกิน 90% ของเครื่อง ระหว่าง 90 ถึง 100% แสดงเป็น “ตึงมาก” เพราะ context ที่ยาวกว่าที่คิดหรือผู้ใช้เพิ่มมาอีกคน จะทำให้ระบบเริ่ม swap และช้าลงมาก
ค่า byte ต่อพารามิเตอร์ที่ใช้
ค่าที่ใช้จริงในรูปแบบ GGUF และ AWQ รวม scale และ tensor ที่เก็บความละเอียดสูงไว้แล้ว จึงสูงกว่าตัวเลขบิตล้วนเล็กน้อย
| SPEC | Bytes / param | เหมาะกับ |
|---|---|---|
| FP16 / BF16 | 2.00 | งานวิจัย, fine-tune, เทียบคุณภาพต้นฉบับ |
| FP8 / INT8 | 1.00 | โปรดักชันที่ต้องการคุณภาพใกล้ต้นฉบับบน Blackwell |
| Q6_K | 0.82 | llama.cpp เมื่อหน่วยความจำเหลือพอ |
| Q5_K_M | 0.70 | ประหยัดกว่า Q6 โดยเสียคุณภาพน้อย |
| Q4_K_M / AWQ / MXFP4 | 0.58 | ค่าเริ่มต้นของการใช้งานทั่วไป และรูปแบบที่ gpt-oss ปล่อยมา |
| NVFP4 | 0.50 | RTX 50 series และ GB10 ที่รองรับ FP4 ในฮาร์ดแวร์ |
คำถามที่ถูกถามบ่อย
- ทำไมโมเดล 70B ถึงต้องใช้หน่วยความจำมากกว่า 70 GB
- ตัวเลข 70B คือจำนวนพารามิเตอร์ ไม่ใช่ขนาดไฟล์ ที่ FP16 แต่ละพารามิเตอร์ใช้ 2 byte จึงเป็นประมาณ 140 GB ที่ 4-bit เหลือราว 40 GB แล้วยังต้องบวก KV cache ของทุกบทสนทนาที่เปิดอยู่ และหน่วยความจำของ runtime อีกราว 1 ถึง 2 GB
- โมเดล MoE อย่าง Qwen3 235B-A22B ต้องใช้หน่วยความจำเท่าไร
- ต้องโหลดน้ำหนักทั้ง 235B เข้าหน่วยความจำ แต่แต่ละ token ใช้เพียง 22B ในการคำนวณ จึงต้องมีความจุระดับ 130 GB ขึ้นไปที่ 4-bit แต่ได้ความเร็วใกล้โมเดล 22B นี่คือเหตุผลที่ DGX Spark 128 GB ตึงกับโมเดลนี้ และเครื่อง 2 GPU 96 GB เหมาะกว่า
- ทำไมเครื่องคำนวณถึงบอกว่า Mac Studio พอดี แต่ไม่แนะนำ
- Mac Studio อยู่ในรายการเพื่อเปรียบเทียบอย่างยุติธรรม เพราะหลายคนกำลังชั่งใจอยู่ แต่เราไม่ได้ประกอบหรือติดตั้งซอฟต์แวร์บนเครื่อง Apple คำแนะนำจึงชี้ไปที่เครื่องที่เราส่งมอบเท่านั้น อ่านการเปรียบเทียบเต็มได้ที่หน้า DGX Spark vs Mac Studio
- เพดาน tok/s ที่แสดงคืออะไร ใช้เป็นตัวเลขจริงได้ไหม
- เป็นขอบบนทางฟิสิกส์: bandwidth ของหน่วยความจำหารด้วยขนาดน้ำหนักที่ต้องอ่านต่อ token ของจริงต่ำกว่านี้เสมอเพราะมีการคำนวณ attention, การจัดตาราง และ overhead ของซอฟต์แวร์ ใช้เพื่อเทียบเครื่องต่อเครื่อง ไม่ใช่เพื่อสัญญาความเร็ว
ยังไม่แน่ใจว่าเครื่องไหนพอ? ให้เราคำนวณจากงานจริงของคุณ
บอกโมเดล จำนวนผู้ใช้ และงานที่จะทำ เราตอบกลับพร้อมสเปกที่แนะนำ ทางเลือก และช่วงราคาที่รวมการติดตั้ง Mimir Suites