# GLM-52 Runs on RTX 4090

By [nanobro](https://blog.nanobro.co) · 2026-06-18

ai, nanobro, deepseek, glm5.2, gpu

---

รันได้ด้วย 4090 x 24 อัน ประมาณ 1.5 ล้านบาท

ได้พลังใกล้เคียง Opus 4.6(?)

* * *

GLM-5.2 โมเดล 753B พารามิเตอร์ รันบน RTX 4090 ได้แล้ว — frontier model ออกจากการ์ด数据中心 สู่ผู้บริโภค

เมื่อสัปดาห์ที่แล้ว @totheagi (Ning) ประกาศความสำเร็จที่น่าตื่นเต้นมากในวงการ AI — เขาเป็นคนแรกที่สามารถรัน GLM-5.2 แบบเต็มๆ บน NVIDIA RTX 4090 การ์ดคอนซูมเมอร์ได้สำเร็จ

GLM-5.2 คือโมเดล open-weights ขนาด 753B พารามิเตอร์ ที่พัฒนาโดย Zai-org (ทีมเดิมที่เกี่ยวข้องกับ DeepSeek) และถูกจัดว่าเป็น SOTA (State of the Art) ในกลุ่ม open-weight models ปัจจุบัน

แต่ปัญหาคือ — โมเดลนี้ officially รองรับเฉพาะ Datacenter GPU เท่านั้น ได้แก่ H100, H200 และ B200 เพราะ sparse-attention kernel stack ของมันถูก lock ไว้ที่ sm\_90 / sm\_100 architecture โดยไม่มี fallback สำหรับการ์ดคอนซูมเมอร์อย่าง RTX 4090 (sm\_89)

แล้วเขาทำยังไง?

ทีมของ renning22 ได้เขียน ada\_dsa.py — ไฟล์ที่ monkeypatch kernel ทั้งหมดของ GLM-5.2 ให้ทำงานบน Ada generation (RTX 4090) ได้ โดยแทนที่จะใช้ WGMMA tilelang path ที่เฉพาะ Hopper/Blackwell มี เขาใช้ Triton + non-WGMMA tilelang path แทน

kernel ที่ถูก port กลับไปมี 3 ส่วนหลัก:

1.  Lightning-indexer GEMM — matrix multiplication สำหรับ sparse attention
    
2.  Top-k + page-mapping transforms — การเลือกและจัดหน้าข้อมูลใน KV cache
    
3.  MLA sparse decode — sparse decoding mechanism ของโมเดล
    

ทุก kernel ถูก validate กับ reference แล้วได้ความแม่นยำ ~1e-6 (cosine similarity 0.999999 บน real tensors ของโมเดลจริง)

สเปกที่ต้องใช้

เนื่องจาก FP8 weights ของ GLM-5.2 มีขนาดประมาณ 753 GB การรันแบบ full model จึงต้องการการ์ดจำนวนมาก:

• RTX 4090 48GB: 24 การ์ด (3 โหนด × 8 การ์ด) — TP=8 × PP=3 → ทดสอบแล้ว ทำงานได้จริง • RTX 4090 24GB: ประมาณ 40-48 การ์ด (ประมาณการ) • RTX 5090 32GB: ประมาณ 32 การ์ด (ประมาณการ)

ความเร็วที่ได้ประมาณ 10 tokens/sec ต่อ single stream (ใช้ CUDA-graph) ซึ่งถือว่า interactive speed สำหรับโมเดลขนาด 753B บนการ์ดคอนซูมเมอร์ ถ้าไม่ใช้ CUDA-graph จะได้ประมาณ 2.5 tokens/sec เท่านั้น

ทำไมเรื่องนี้สำคัญ?

GLM-5.2 ไม่ใช่โมเดลเล็กๆ — มันคือ frontier model ที่ปกติเฉพาะห้องแล็บและบริษัทใหญ่ๆ ที่มี H100 cluster ถึงจะเข้าถึงได้ การที่ใครสักคนสามารถ port kernel stack ทั้งหมดไปรันบน RTX 4090 ได้สำเร็จ แสดงว่า:

1.  Frontier open models กำลัง democratize เข้าถึงได้ง่ายขึ้น
    
2.  Sparse attention architecture ทำให้โมเดลขนาดใหญ่ทำงานบน hardware ที่จำกัดได้ดีขึ้น
    
3.  Port นี้ model-agnostic — สามารถนำไปใช้กับ DSA models อื่นๆ ได้ด้วย เช่น DeepSeek-V3.2-style
    

วิธีติดตั้งและรัน

โปรเจกต์มี one-call installer (apply\_sglang\_patches.py) ที่ patch sglang ให้รองรับ ada\_dsa kernels โดยอัตโนมัติ ต้องใช้ sglang build ที่มี nsa / tilelang DSA backend และต้องตั้ง --disable-shared-experts-fusion บน Ada (เป็น MoE fix จำเป็น)

License ของโปรเจกต์เป็น Apache-2.0 — เปิดให้ใช้งานเชิงพาณิชย์ได้เต็มที่

ลิงก์ต้นฉบับ: [https://x.com/totheagi/status/2067589730104213740](https://x.com/totheagi/status/2067589730104213740) GitHub: [https://github.com/renning22/glm-5.2-4090](https://github.com/renning22/glm-5.2-4090)

---

*Originally published on [nanobro](https://blog.nanobro.co/glm-52-runs-on-rtx-4090)*
