Class / RTX 5090 single-GPU tower
RTX 5090 รัน LLM อะไรได้บ้าง
RTX 5090 กับงาน AI ในองค์กร: VRAM 32 GB GDDR7, bandwidth 1.79 TB/s, โมเดลที่พอดีที่ 4-bit, ข้อควรระวังเรื่องไฟและความร้อน และสเปกเครื่องที่เราประกอบให้
RTX 5090 มี VRAM 32 GB จึงรันโมเดลถึงราว 32B แบบ 4-bit ได้เต็มการ์ด เช่น Qwen3 32B, Mistral Small 24B และ gpt-oss-20b ส่วน Llama 3.3 70B ไม่พอบนการ์ดเดียว จุดแข็งคือ bandwidth 1.79 TB/s ที่ทำให้โมเดลในช่วงนี้ตอบเร็วที่สุดในงบประมาณระดับนี้ ถ้าโมเดลของคุณใหญ่กว่า 32 GB ให้ดู DGX Spark หรือเครื่องหลายการ์ดแทน
| SPEC | GeForce RTX 5090 |
|---|---|
| Architecture | Blackwell, 21,760 CUDA cores, 5th gen Tensor Cores พร้อม FP4 |
| Memory | 32 GB GDDR7, บัส 512-bit |
| Bandwidth | 1.79 TB/s |
| Power | การ์ด 575 W, ต้องใช้ PSU 1,000 W ขึ้นไป, หัวต่อ 12V-2x6 |
| Interface | PCIe 5.0 x16, ความหนา 2 ถึง 3.5 slot แล้วแต่ผู้ผลิต |
| Platform ที่เราใช้ | AMD Ryzen 9 หรือ Intel Core Ultra, RAM 64 ถึง 128 GB DDR5, NVMe 2 ถึง 4 TB, PSU 1,000 ถึง 1,200 W |
| Price band | ประมาณ 120,000 ถึง 220,000 บาท ทั้งเครื่อง แล้วแต่ CPU และ RAM |
เร็วที่สุดในราคานี้ ถ้าโมเดลใส่พอ
bandwidth 1.79 TB/s คือตัวเลขที่ทำให้ RTX 5090 น่าสนใจ: โมเดล 32B แบบ 4-bit อ่านน้ำหนักได้เกือบร้อยรอบต่อวินาที ข้อจำกัดเดียวคือ 32 GB ต้องพอ
เหมาะเมื่อ
- โมเดลเป้าหมายอยู่ในช่วง 7B ถึง 32B และต้องการเวลาตอบสั้น
- งานผสมระหว่าง LLM กับการสร้างภาพหรือวิดีโอ (ComfyUI, Stable Diffusion, Flux)
- นักพัฒนาคนเดียวหรือทีม 2 ถึง 10 คนที่ใช้โมเดลเล็กพร้อมกัน
- งบประมาณระดับ 120,000 ถึง 220,000 บาท สำหรับทั้งเครื่อง
ข้อควรระวัง
- ความร้อน 575 W ในเคสปิด: เราเลือกเคสที่มีลมเข้าด้านหน้าเต็มแผงและวางการ์ดให้มีช่องหายใจ
- หัวต่อ 12V-2x6 ต้องเสียบให้สุดและไม่งอสายใกล้หัว เราตรวจอุณหภูมิหัวต่อระหว่าง burn-in
- ไดรเวอร์ GeForce ไม่มี ECC และไม่รองรับ MIG: ถ้าต้องแบ่งการ์ดให้หลายทีมอย่างเป็นทางการ ดู RTX PRO 6000
32 GB รันโมเดลอะไรได้บ้าง
ปรับ context และจำนวนผู้ใช้ของคุณเองได้ใน เครื่องคำนวณ จำไว้ว่า KV cache ของผู้ใช้ 10 คนที่ context 16K บนโมเดล 32B กินราว 10 GB ด้วยตัวมันเอง
| SPEC | Quantization | หมายเหตุ |
|---|---|---|
| Qwen3 8B, Llama 3.1 8B | FP16 | คุณภาพเต็ม พร้อม context ยาวสำหรับหลายคน |
| Qwen3 14B, DeepSeek-R1 Distill 14B | FP8 | จุดสมดุลของคุณภาพและความเร็วสำหรับทีมเล็ก |
| Qwen3 32B, DeepSeek-R1 Distill 32B, Mistral Small 24B | Q4 / NVFP4 | ราว 20 GB สำหรับน้ำหนัก เหลือ 10 GB ให้ KV cache |
| Qwen3 30B-A3B | Q4 | MoE ที่เร็วมากบนการ์ดนี้ เหมาะกับงานตอบสั้นจำนวนมาก |
| gpt-oss-20b | MXFP4 | ราว 13 GB ใช้พร้อมโมเดลอื่นบนการ์ดเดียวได้ |
| Llama 3.3 70B | ทุกระดับ | ไม่พอ: ต้อง 2 การ์ด, RTX PRO 6000 หรือ DGX Spark |
เครื่องที่เราประกอบ
ไม่มีสเปกตายตัว เพราะ CPU และ RAM ขึ้นกับว่าคุณจะทำอะไรนอกจากรัน LLM แต่ทุกเครื่องมีสิ่งเหล่านี้เหมือนกัน:
- PSU 1,000 W ขึ้นไป มาตรฐาน ATX 3.1 พร้อมสาย 12V-2x6 จากโรงงาน
- RAM อย่างน้อย 2 เท่าของ VRAM เพื่อโหลดโมเดลและเตรียมข้อมูลได้ลื่น
- NVMe แยก สำหรับโมเดลและข้อมูลของ Mimir Suites
- Ubuntu LTS + ไดรเวอร์ NVIDIA + vLLM หรือ llama.cpp ตั้งค่าและทดสอบด้วยโมเดลที่คุณจะใช้
- Mimir Suites พร้อมบัญชีผู้ใช้ และการเข้าถึงระยะไกลที่ปลอดภัย
ถ้า 32 GB ไม่พอ อ่านเรื่อง DGX Spark ที่ให้ 128 GB หรือคุยกับเราเรื่อง RTX PRO 6000 และเครื่องหลายการ์ด
คำถามที่ถูกถามบ่อย
- RTX 5090 รัน Llama 70B ได้ไหม
- บนการ์ดเดียวไม่ได้ Llama 3.3 70B ที่ 4-bit ใช้ราว 43 GB เกิน 32 GB การ offload บางชั้นไปยัง RAM ทำได้ทางเทคนิคแต่ช้าลงจนใช้งานจริงลำบาก ทางเลือกคือ 2x RTX 5090 (64 GB), RTX PRO 6000 (96 GB) หรือ DGX Spark (128 GB)
- เครื่อง RTX 5090 ใช้ไฟบ้านได้ไหม
- ได้ การ์ดใช้สูงสุด 575 W เครื่องทั้งระบบราว 800 ถึง 900 W ที่โหลดเต็ม ปลั๊กและวงจร 220 V ทั่วไปรับได้ แต่เราแนะนำ UPS และไม่ต่อร่วมวงจรกับเครื่องปรับอากาศ สำหรับ 2 การ์ดขึ้นไปควรมีวงจรแยก
- RTX 5090 กับ RTX PRO 6000 ต่างกันแค่หน่วยความจำหรือไม่
- ต่างที่หน่วยความจำ 32 GB เทียบ 96 GB ECC, ไดรเวอร์ระดับ enterprise, รองรับ MIG แบ่งการ์ดเป็นหลายส่วน, ระบายความร้อนแบบ blower ที่ใส่หลายการ์ดในเครื่องเดียวได้ และราคาที่สูงกว่าราว 3 เท่า ความเร็วในการสร้าง token ต่อการ์ดใกล้เคียงกันเพราะ bandwidth เท่ากัน
- ใช้ Windows ได้ไหม
- ได้ทั้ง Windows 11 และ Ubuntu เราแนะนำ Ubuntu สำหรับเครื่องที่ทีมใช้ร่วมกันผ่าน Mimir Suites เพราะ vLLM และเครื่องมือเซิร์ฟเวอร์ทำงานเสถียรกว่า ส่วนเครื่องส่วนตัวของนักพัฒนาที่ต้องใช้ซอฟต์แวร์ Windows ด้วย เราติดตั้งแบบ dual boot หรือ WSL2 ให้
อยากได้เครื่อง RTX 5090 ที่ประกอบและติดตั้งเสร็จ
บอกโมเดล จำนวนผู้ใช้ และงานที่จะทำ เราตอบกลับพร้อมสเปกที่แนะนำ ทางเลือก และช่วงราคาที่รวมการติดตั้ง Mimir Suites