
Step 5 Preview vs GLM-5.3: ห่างกันเพียงหนึ่งคะแนน และมีเพียงหนึ่งเดียวในนั้นเท่านั้นที่มีไฟล์สัญญาอนุญาต
- Orcaใหม่Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 ต่อ 1 ล้านโทเค็น
- orcaใหม่Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 ต่อ 1 ล้านโทเค็น
- deepseekใหม่DeepSeek: DeepSeek V4.1 Flash2026-09-1040ความฉลาด
- openaiOpenAI: GPT-6 Astra2026-09-0453ความฉลาด77การเขียนโค้ด
- googleGoogle: Gemini 3.8 Flash2026-09-0241ความฉลาด76การเขียนโค้ด
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245ความฉลาด76การเขียนโค้ด
- anthropicAnthropic: Claude Fable 5.12026-09-0153ความฉลาด82การเขียนโค้ด
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642ความฉลาด72การเขียนโค้ด
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 ต่อ 1 ล้านโทเค็น
- z-aiZ.ai: GLM 5.32026-08-1845ความฉลาด75การเขียนโค้ด
- obsidianQwen3.8 27B2026-08-1534ความฉลาด68การเขียนโค้ด
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236ความฉลาด69การเขียนโค้ด
- grokSpaceXAI: Grok 4.62026-08-1244ความฉลาด77การเขียนโค้ด
- metaMeta: Muse Spark 1.22026-08-0540ความฉลาด72การเขียนโค้ด
- qwenQwen: Qwen3.8 Max2026-08-0345ความฉลาด76การเขียนโค้ด
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135ความฉลาด69การเขียนโค้ด
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 ต่อ 1 ล้านโทเค็น
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
บนบอร์ดอิสระ Step 5 PreviewกับGLM-5.3ห่างกันอยู่หนึ่งคะแนน: 44 ต่อ 45 บน Artificial Analysis Intelligence Index v4.3.2 โดย GLM-5.3 ถูกให้คะแนนในชื่อ GLM-5.3 (max) ส่วน Step 5 Preview ไม่มีป้ายกำกับระดับความพยายามใด ๆ เลย นั่นคือช่องว่างที่แคบที่สุดในซีรีส์นี้ และยังเป็นตัวเลขที่มีประโยชน์น้อยที่สุดในการเปรียบเทียบนี้ด้วย ตัวเลขที่ตัดสินทุกอย่างคือ GLM-5.3 มีเวตให้ดาวน์โหลดได้ตั้งแต่วันนี้ — เผยแพร่โดย Z.ai ภายใต้สัญญาอนุญาตแบบกำหนดเองที่ไม่ใช่ MIT — ขณะที่ Step 5 Preview ซึ่ง StepFun ประกาศเมื่อวันที่ 20 กันยายน 2026 มีที่เก็บบน Hugging Face ที่มีเพียง .gitattributesไฟล์เดียว และระบุวันเปิดตัววันที่ 15 ตุลาคมสำหรับเช็กพอยต์ BF16 เอกสารเปิดตัวของ StepFun อธิบายว่าโมเดลนี้เป็นผลลัพธ์โอเพนซอร์สระดับสามอันดับแรก แต่ตอนนี้มันยังไม่ใช่โอเพนซอร์ส ส่วน GLM-5.3 เป็น และสัญญาอนุญาตของมันคือสิ่งที่ต้องอ่านก่อนที่คุณจะวางแผนโดยอิงกับมัน
หนึ่งจุดดัชนีซื้ออะไรได้จริง
โมเดลทั้งสองถูกทดสอบผ่านการประเมินสิบชุดเดียวกันโดยห้องแล็บเดียวกัน ซึ่งทำให้การเปรียบเทียบนั้นทั้งสะอาดเป็นพิเศษและไม่เป็นประโยชน์เป็นพิเศษในเวลาเดียวกัน
• ดัชนีความฉลาด — Step 5 Preview 44 vs GLM-5.3 45
• เมื่อเทียบตำแหน่ง — GLM-5.3 สูงกว่า Step 5 Preview อยู่หนึ่งคะแนน; Step 5 Preview อยู่ระดับเดียวกับ Kimi K3
• พารามิเตอร์ — Step 5 Preview 600B ทั้งหมด / 27B ที่ใช้งาน เทียบกับ GLM-5.3 753B ทั้งหมด / 40B ที่ใช้งาน
• ความเร็วเอาต์พุต — Step 5 Preview 99.8 โทเคน/วินาที เทียบกับ GLM-5.3 72.1 โทเคน/วินาที
• เวลาถึงโทเคนแรก — Step 5 Preview 2.96s เทียบกับ GLM-5.3 2.99s
• ราคาต่อ 1M โทเคน — Step 5 Preview $1.00 ขาเข้า / $2.70 ขาออก เทียบกับ GLM-5.3 $1.40 ขาเข้า / $4.40 ขาออก
• ส่วนลดแคช — Step 5 Preview 95% vs GLM-5.3 81%
• ค่าใช้จ่ายต่องาน Intelligence Index — Step 5 Preview $0.71 เทียบกับ GLM-5.3 $2.01
• บริบท — ทั้งคู่ 1M โทเค็น; แค็ตตาล็อกของเราระบุ GLM-5.3 ที่มีเพดานเอาต์พุต 131.1K ส่วน StepFun ยังไม่เผยแพร่ค่าดังกล่าว
• น้ำหนักโมเดล — Step 5 Preview ปิดให้บริการแล้ว, เช็คพอยต์ BF16 มีกำหนดในวันที่ 15 ตุลาคม; GLM-5.3 เผยแพร่ภายใต้สัญญาอนุญาต Z.ai แบบกำหนดเอง
อ่านแถวเหล่านั้นประกอบกันแล้ว ช่องว่างเพียงหนึ่งจุดก็เลิกเป็นประเด็นพาดหัวทันที Step 5 Preview ถูกกว่า 29% ในด้านอินพุต ถูกกว่า 39% ในด้านเอาต์พุต สร้างโทเคนเร็วขึ้น 38% และมีส่วนลดแคชลึกกว่า 14 จุด อีกทั้งตัวเลขต้นทุนต่องานจัดทำดัชนี ซึ่งรวบทั้งความยาวเฟ้อของคำและพฤติกรรมแคชไว้ในตัวเลขเดียวนั้น ต่ำกว่า 2.8 เท่า ทั้งหมดนี้ทำได้ด้วยขนาดรวม 600B เทียบกับ 753B ของ GLM-5.3 โดยมีพารามิเตอร์ที่ใช้งานจริง 27B เทียบกับ 40B บนแกนประสิทธิภาพ นี่ไม่ใช่การวัดกำลังที่สูสีกันเลย แต่บนแกนความสามารถ มันสูสีกันที่สุดเท่าที่ตารางนี้จะเป็นได้
แถวเดียวที่ Step 5 Preview ไม่ชนะคือแถวที่แก้ไขยากที่สุด: GLM-5.3 มีไฟล์ใบอนุญาต แต่ Step 5 Preview ไม่มี
สัญญาอนุญาตคือความแตกต่างทั้งหมด และมันไม่ใช่ MIT
มันเป็นเรื่องง่ายที่จะสันนิษฐานว่าโมเดลเรือธงแบบเปิดของแล็บจีนนั้นเผยแพร่ภายใต้ MIT เพราะหลายแห่งทำเช่นนั้น GLM-5.2 และ GLM-5.3-Flash ของ Z.ai เองก็ใช้ MIT ทั้งคู่ แต่ GLM-5.3 ซึ่งเป็นเรือธงไม่เป็นเช่นนั้น — มันเผยแพร่ภายใต้สัญญาอนุญาต "glm-5.3" แบบกำหนดเอง ซึ่งอนุญาตให้ใช้เชิงพาณิชย์ได้โดยมีข้อจำกัดหลายประการ นั่นเป็นเอกสารที่แตกต่างอย่างมีนัยสำคัญจากข้อกำหนด MIT ที่น้องเล็กของมันใช้ และสำหรับบริษัทที่ทนายความอ่านสัญญาอนุญาตก่อนอ่าน README มันเป็นการสนทนามากกว่าพิธีการ
Step 5 Preview ยังไม่มีสัญญาอนุญาตใด ๆ เลย ซึ่งเป็นปัญหาที่แตกต่างออกไป และไม่ชัดเจนว่าเป็นปัญหาที่เล็กกว่า สัญญาอนุญาตแบบจำกัดบอกคุณว่าคุณทำอะไรได้บ้าง และปล่อยให้คุณตัดสินใจเองว่าเงื่อนไขนั้นยอมรับได้หรือไม่ การไม่มีสัญญาอนุญาตไม่ได้บอกอะไรคุณเลย: ไม่มีการอนุญาตให้ใช้เชิงพาณิชย์ ไม่มีสิทธิ์ในการแจกจ่ายต่อ ไม่มีสิทธิ์ในการปรับแต่งละเอียด และไม่มีทางประเมินได้ว่าเช็กพอยต์วันที่ 15 ตุลาคมจะใช้งานกับผลิตภัณฑ์ของคุณได้หรือไม่ จนกว่ามันจะปรากฏออกมา ชื่อรีโพซิทอรีที่ StepFun สงวนไว้ — stepfun-ai/Step-5-Preview-BF16 — ระบุรูปแบบ bfloat16 ซึ่งเป็นอาร์ติแฟกต์ที่คุณใช้ปรับแต่งละเอียดและควอนไทซ์จากมัน มากกว่าตัวที่คุณนำไปให้บริการ นั่นบอกคุณถึงรูปร่างของการเปิดตัว แต่ไม่ได้บอกเงื่อนไขของมัน
ดังนั้นการเปรียบเทียบที่ซื่อตรงจึงอยู่ระหว่างสัญญาอนุญาตที่คุณอ่านได้และไม่เห็นด้วยได้ กับสัญญาอนุญาตที่ไม่มีอยู่จริง สำหรับทีมที่ต้องปรับแต่งโมเดลแบบละเอียด โฮสต์เองในสภาพแวดล้อมที่ควบคุมได้ หรือปล่อยผลิตภัณฑ์ที่ดัดแปลงต่อยอด GLM-5.3 เป็นเพียงหนึ่งเดียวในสองตัวเลือกนี้ที่มีคำตอบ และคำตอบนั้นคือการตรวจสอบทางกฎหมาย ไม่ใช่การอนุมัติไฟเขียว
ช่องว่างด้านประสิทธิภาพคือส่วนที่ยังยืนหยัดได้
คำกล่าวอ้างเรื่องประสิทธิภาพควรได้รับการตั้งข้อกังขามากกว่าคำกล่าวอ้างเรื่องเบนช์มาร์ก เพราะทำได้ง่ายกว่าและตรวจสอบได้ยากกว่า สองข้อนี้ยืนหยัดได้ดีกว่าคำกล่าวอ้างส่วนใหญ่ และกลไกดังกล่าวปรากฏให้เห็นในสถาปัตยกรรม
โมเดล sparse mixture-of-experts ใช้พลังประมวลผลเฉพาะกับ expert ที่โทเคนถูกจัดเส้นทางไปหาเท่านั้น ดังนั้นค่าที่เปิดใช้งานจึงเป็นตัวกำหนดพฤติกรรมการใช้งานจริง ขณะที่จำนวนรวมเป็นเรื่องของหน่วยความจำเป็นหลัก ด้วย 27B active เทียบกับ 40B ของ GLM-5.3, Step 5 Preview ทำงานต่อโทเคนน้อยลงประมาณหนึ่งในสาม และผลการวัดก็เป็นไปตามนั้น: 99.8 โทเคนเอาต์พุตต่อวินาที เทียบกับ 72.1 และค่าใช้จ่ายต่องานจัดทำดัชนี 0.71 ดอลลาร์ เทียบกับ 2.01 ดอลลาร์ นั่นคือเรื่องเดียวกันที่เล่าในสามแบบ ซึ่งเป็นสิ่งที่ทำให้มันน่าเชื่อถือ แทนที่จะเป็นตัวเลขสวยหรูเพียงตัวเดียว
ส่วนลดแคชคือแถวที่สำคัญที่สุดสำหรับเวิร์กโหลดที่ทั้งสองโมเดลถูกนำมาขาย ลูปของเอเจนต์ที่ส่งพรอมป์ต์ระบบและบริบทของรีโพซิทอรีเดิมซ้ำทุกเทิร์นจะอยู่ในส่วนลดนั้นแทบทั้งหมด ดังนั้น 95% เทียบกับ 81% จึงทบต้นสะสมตลอดเซสชันยาวในแบบที่ราคาตั้งทำไม่ได้ ที่ส่วนผสมแคชฮิต / อินพุต / เอาต์พุต 7:2:1 อัตราผสมของ Step 5 Preview อยู่ราว $0.51 ต่อล้านโทเคน เทียบกับอัตราผสมที่สูงกว่าอย่างมีนัยสำคัญของ GLM-5.3 และช่องว่างนี้ยิ่งกว้างขึ้นเมื่อลูปทำงานนานขึ้น
สิ่งที่ยังทดสอบไม่ได้ในตอนนี้คือประสิทธิภาพนั้นจะคงอยู่ได้หรือไม่ในระดับ規模 API ของ Step 5 Preview เปิดให้บริการในวันเปิดตัวบนเอนด์พอยต์เดียว GLM-5.3 ได้รองรับทราฟฟิกโปรดักชันตั้งแต่กลางเดือนสิงหาคมจากผู้เรียกใช้ที่เป็นอิสระหลายราย และโมเดลที่มีภาระงานจริงรองรับมาแล้วห้าสัปดาห์ย่อมมีโหมดความล้มเหลวที่เป็นที่รู้จักในกลุ่มคนจำนวนมากพอจนปรากฏต่อสาธารณะ เอนด์พอยต์ที่เพิ่งเปิดได้ไม่กี่วันไม่มีสิ่งเหล่านั้นเลย ตัวเลขประสิทธิภาพเป็นการตีความที่ดูดีกว่า; ประวัติการดำเนินงานเป็นการตีความที่มีประโยชน์มากกว่า

สิ่งที่คุณสามารถพึ่งพาได้ในแต่ละฝ่ายในวันนี้
นี่คือส่วนเดียวของการเปรียบเทียบที่ทั้งสองฝ่ายไม่สมมาตรกัน และควรพูดให้ตรงเผงเรื่องนี้ แทนที่จะปัดเป็นว่า "ทั้งคู่มีให้ใช้"
GLM-5.3 เปิดให้ใช้งานแล้วบน OrcaRouter ภายใต้z-ai/glm-5.3 ซึ่งเป็นหน้าโมเดล ในราคาอินพุต $1.26 และเอาต์พุต $3.96 เทียบกับราคา $1.40 และ $4.40 ในรายการของ Z.ai บนหน้าโมเดลเอง — ส่งผ่านโดยไม่มีมาร์กอัปเลย ตัวเลขที่คุณเห็นจึงเป็นอัตราปัจจุบันของผู้ให้บริการ ไม่ใช่ราคาที่เรากำหนดเอง น้ำหนักแบบเปิดอยู่บน Hugging Face โมเดลเดียวกันจึงเข้าถึงได้สามวิธี: เอนด์พอยต์ของเรา, API ของ Z.ai เอง หรือฮาร์ดแวร์ของคุณเอง
Step 5 Preview ไม่ได้อยู่ในแคตตาล็อกของเรา และเราไม่ได้จัดเส้นทางให้มันทำงานผ่านเรา มันทำงานบน API และ Studio ของ StepFun เอง และนั่นคือที่เดียวที่มันทำงานจนกว่าเวตจะเปิดตัว สิ่งที่อยู่เคียงข้างมันในฝั่งของเราคือชุดโมเดลที่มันถูกนำมาใช้วัดเปรียบเทียบ หลังคีย์เดียวสำหรับมากกว่า 200 โมเดล: GLM-5.3 ในอัตราส่วนลดข้างต้น, DeepSeek V4 Pro ที่ $0.66 และ $1.98 และ Claude Opus 5 ที่ $5.00 และ $25.00 นั่นคือสิ่งที่ทำให้สี่สัปดาห์ข้างหน้าดำเนินไปได้แทนที่จะถูกบล็อก — คุณสามารถวัดประสิทธิภาพของพรีวิวเทียบกับโมเดลโปรดักชันบนคีย์เดียวกัน โดยมี automatic failover ข้ามผู้ให้บริการคอยประคองเส้นทางโปรดักชันไว้ในขณะที่เส้นโค้งความจุของพรีวิวยังไม่เป็นที่ทราบ และ routing DSL ที่ประกอบขาโปรดักชันให้เป็นการเรียกครั้งเดียวแทนที่จะเป็นการผสานรวมครั้งที่สอง

การเลือกระหว่างลีดกับผลงานที่ผ่านมา
หากคุณกำลัง fine-tuning, self-hosting หรือสร้างผลิตภัณฑ์ดัดแปลง GLM-5.3 คือคำตอบ และไม่ใช่การแข่งขันที่สูสี — ไม่ใช่เพราะมันได้คะแนนสูงกว่าหนึ่งคะแนน แต่เพราะมันเป็นเพียงหนึ่งเดียวในสองตัวนี้ที่มีใบอนุญาตให้อ่านและมี checkpoint ให้ดาวน์โหลด กันงบไว้สำหรับการตรวจสอบทางกฎหมายด้วย เพราะข้อกำหนดเฉพาะนั้นไม่ใช่ MIT และความแตกต่างแบบนี้คือประเภทที่โผล่ขึ้นมาในการตรวจสอบจัดซื้อจัดจ้าง ไม่ใช่ใน benchmark
ถ้าคุณกำลังเรียกโมเดลผ่าน API และปริมาณงานของคุณคือข้อความแบบเอเจนต์ในระดับมาก Step 5 Preview เหนือกว่าทุกสิ่งที่ใบแจ้งหนี้และเวลาสนใจ: ถูกกว่าต่อโทเคน ถูกกว่าต่องาน สร้างได้เร็วกว่า และมีส่วนลดแคชที่ลึกกว่าสำหรับรูปแบบคำนำหน้าที่ซ้ำซึ่งเติมเต็มลูปของเอเจนต์ เมื่อเทียบกับเอนด์พอยต์แหล่งเดียวที่เพิ่งมีอายุไม่กี่วัน ซึ่งไม่มีเพดานเอาต์พุตที่เผยแพร่และไม่มีใบอนุญาต เหตุผลในการทำให้มันเป็นค่าเริ่มต้นของคุณจึงเป็นเรื่องเกี่ยวกับเบนช์มาร์ก ไม่ใช่เกี่ยวกับสัญญา
สิ่งที่เปลี่ยนคำตอบได้คือเช็คพอยต์วันที่ 15 ตุลาคม สัญญาอนุญาตแบบเปิดกว้างจะทำให้ความได้เปรียบด้านประสิทธิภาพกลายเป็นสิ่งที่คุณเป็นเจ้าของได้แทนที่จะต้องเช่า และเมื่อถึงจุดนั้น การขาดไปหนึ่งคะแนนก็เลิกมีความสำคัญ — โมเดลที่ถูกกว่าถึง 2.8 เท่าต่องานดัชนีแต่ละงาน และเร็วกว่า 38% ในการสร้าง ไม่จำเป็นต้องชนะในคะแนนรวม ส่วนสัญญาอนุญาตแบบจำกัดจะทำให้ GLM-5.3 เป็นเพียงหนึ่งเดียวในคู่นี้ที่คุณสร้างผลิตภัณฑ์บนนั้นได้ และช่องว่างหนึ่งคะแนนก็กลายเป็นเรื่องไม่สำคัญเกี่ยวกับสองโมเดลที่คุณก็คงใช้งานต่างกันอยู่ดี
สเปกเดียวที่ควรจับตาคือเพดานเอาต์พุต ผู้ขายทั้งสองรายโฆษณาคอนเท็กซ์ 1M โทเคน แค็ตตาล็อกของเราระบุ GLM-5.3 ที่เอาต์พุตสูงสุด 131.1K ประกาศของ StepFun ระบุคอนเท็กซ์ 1M และไม่มีเพดานเอาต์พุต ส่วนการกำหนดค่าของบุคคลที่สามอีกชุดที่เผยแพร่ระหว่างการรั่วไหลระบุคอนเท็กซ์ 350,000 พร้อมเอาต์พุตสูงสุด 64,000 สำหรับโมเดลคู่หนึ่งที่วางขายบนงานเอเจนต์ระยะยาว ตัวเลขนั้นตัดสินว่าคุณสร้างอะไรได้จริง และตอนนี้มีเพียงฝ่ายเดียวที่ตอบเรื่องนี้

การเปรียบเทียบในบทความนี้1
ตรวจพบจากบทความนี้ · เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
