GLM-52 Runs on RTX 4090

รันได้ด้วย 4090 x 24 อัน ประมาณ 1.5 ล้านบาท

ได้พลังใกล้เคียง Opus 4.6(?)


GLM-5.2 โมเดล 753B พารามิเตอร์ รันบน RTX 4090 ได้แล้ว — frontier model ออกจากการ์ด数据中心 สู่ผู้บริโภค

เมื่อสัปดาห์ที่แล้ว @totheagi (Ning) ประกาศความสำเร็จที่น่าตื่นเต้นมากในวงการ AI — เขาเป็นคนแรกที่สามารถรัน GLM-5.2 แบบเต็มๆ บน NVIDIA RTX 4090 การ์ดคอนซูมเมอร์ได้สำเร็จ

GLM-5.2 คือโมเดล open-weights ขนาด 753B พารามิเตอร์ ที่พัฒนาโดย Zai-org (ทีมเดิมที่เกี่ยวข้องกับ DeepSeek) และถูกจัดว่าเป็น SOTA (State of the Art) ในกลุ่ม open-weight models ปัจจุบัน

แต่ปัญหาคือ — โมเดลนี้ officially รองรับเฉพาะ Datacenter GPU เท่านั้น ได้แก่ H100, H200 และ B200 เพราะ sparse-attention kernel stack ของมันถูก lock ไว้ที่ sm_90 / sm_100 architecture โดยไม่มี fallback สำหรับการ์ดคอนซูมเมอร์อย่าง RTX 4090 (sm_89)

แล้วเขาทำยังไง?

ทีมของ renning22 ได้เขียน ada_dsa.py — ไฟล์ที่ monkeypatch kernel ทั้งหมดของ GLM-5.2 ให้ทำงานบน Ada generation (RTX 4090) ได้ โดยแทนที่จะใช้ WGMMA tilelang path ที่เฉพาะ Hopper/Blackwell มี เขาใช้ Triton + non-WGMMA tilelang path แทน

kernel ที่ถูก port กลับไปมี 3 ส่วนหลัก:

  1. Lightning-indexer GEMM — matrix multiplication สำหรับ sparse attention

  2. Top-k + page-mapping transforms — การเลือกและจัดหน้าข้อมูลใน KV cache

  3. MLA sparse decode — sparse decoding mechanism ของโมเดล

ทุก kernel ถูก validate กับ reference แล้วได้ความแม่นยำ ~1e-6 (cosine similarity 0.999999 บน real tensors ของโมเดลจริง)

สเปกที่ต้องใช้

เนื่องจาก FP8 weights ของ GLM-5.2 มีขนาดประมาณ 753 GB การรันแบบ full model จึงต้องการการ์ดจำนวนมาก:

• RTX 4090 48GB: 24 การ์ด (3 โหนด × 8 การ์ด) — TP=8 × PP=3 → ทดสอบแล้ว ทำงานได้จริง • RTX 4090 24GB: ประมาณ 40-48 การ์ด (ประมาณการ) • RTX 5090 32GB: ประมาณ 32 การ์ด (ประมาณการ)

ความเร็วที่ได้ประมาณ 10 tokens/sec ต่อ single stream (ใช้ CUDA-graph) ซึ่งถือว่า interactive speed สำหรับโมเดลขนาด 753B บนการ์ดคอนซูมเมอร์ ถ้าไม่ใช้ CUDA-graph จะได้ประมาณ 2.5 tokens/sec เท่านั้น

ทำไมเรื่องนี้สำคัญ?

GLM-5.2 ไม่ใช่โมเดลเล็กๆ — มันคือ frontier model ที่ปกติเฉพาะห้องแล็บและบริษัทใหญ่ๆ ที่มี H100 cluster ถึงจะเข้าถึงได้ การที่ใครสักคนสามารถ port kernel stack ทั้งหมดไปรันบน RTX 4090 ได้สำเร็จ แสดงว่า:

  1. Frontier open models กำลัง democratize เข้าถึงได้ง่ายขึ้น

  2. Sparse attention architecture ทำให้โมเดลขนาดใหญ่ทำงานบน hardware ที่จำกัดได้ดีขึ้น

  3. Port นี้ model-agnostic — สามารถนำไปใช้กับ DSA models อื่นๆ ได้ด้วย เช่น DeepSeek-V3.2-style

วิธีติดตั้งและรัน

โปรเจกต์มี one-call installer (apply_sglang_patches.py) ที่ patch sglang ให้รองรับ ada_dsa kernels โดยอัตโนมัติ ต้องใช้ sglang build ที่มี nsa / tilelang DSA backend และต้องตั้ง --disable-shared-experts-fusion บน Ada (เป็น MoE fix จำเป็น)

License ของโปรเจกต์เป็น Apache-2.0 — เปิดให้ใช้งานเชิงพาณิชย์ได้เต็มที่

ลิงก์ต้นฉบับ: https://x.com/totheagi/status/2067589730104213740 GitHub: https://github.com/renning22/glm-5.2-4090