
เผยความจริง GLM-5.3-Flash: "Ox Alpha" นิรนามคือโมเดลมัลติโมดัลแนวหน้าแบบเปิดของ Zhipu มาโดยตลอด
- DeepSeekใหม่DeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 ต่อ 1 ล้านโทเค็น
- z-aiใหม่Z.ai: GLM 5.32026-08-1860ความฉลาด75การเขียนโค้ด
- obsidianใหม่Qwen3.8 27B2026-08-1552ความฉลาด68การเขียนโค้ด
- qwenใหม่Qwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253ความฉลาด69การเขียนโค้ด
- grokSpaceXAI: Grok 4.62026-08-1261ความฉลาด77การเขียนโค้ด
- metaMeta: Muse Spark 1.22026-08-0557ความฉลาด72การเขียนโค้ด
- qwenQwen: Qwen3.8 Max2026-08-0358ความฉลาด72การเขียนโค้ด
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152ความฉลาด69การเขียนโค้ด
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 ต่อ 1 ล้านโทเค็น
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463ความฉลาด78การเขียนโค้ด
- googleGoogle: Gemini 3.6 Flash2026-07-2152ความฉลาด69การเขียนโค้ด
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137ความฉลาด49การเขียนโค้ด
- metaMeta: Muse Spark 1.12026-07-1653ความฉลาด71การเขียนโค้ด
- kimiMoonshotAI: Kimi K32026-07-1560ความฉลาด76การเขียนโค้ด
- openaiOpenAI: GPT-5.6 Luna2026-07-0952ความฉลาด71การเขียนโค้ด
- openaiOpenAI: GPT-5.6 Terra2026-07-0957ความฉลาด77การเขียนโค้ด
- openaiOpenAI: GPT-5.6 Sol2026-07-0961ความฉลาด77การเขียนโค้ด
โมเดลที่ครองอันดับหนึ่งในชาร์ตการใช้งานบนแพลตฟอร์มเขียนโค้ดของบุคคลที่สามตลอดหนึ่งสัปดาห์ ในที่สุดก็มีชื่อและราคาออกมา เมื่อวันที่ 26 สิงหาคม 2026 Zhipu AI ยืนยันว่าโมเดลฟรี "Ox Alpha" ที่นักพัฒนากำลังใช้งานอย่างหนักตั้งแต่วันที่ 20 สิงหาคม คือ GLM-5.3-Flash — โมเดล mixture-of-experts ที่มีพารามิเตอร์รวม 320 พันล้าน ใช้งานจริง 18 พันล้าน (320B-A18B) เป็นรุ่นแรกในซีรีส์ GLM-5 ที่เป็นมัลติโมดัลโดยกำเนิด และเป็นหนึ่งในโมเดลระดับแนวหน้าที่ถูกที่สุดในเรตการ์ดใดๆ ตอนเปิดตัว Zhipu ตั้งราคา GLM-5.3-Flash ที่หนึ่งในสิบของอัตรา API ของ GLM-5.3 รุ่นเรือธง หรือหนึ่งในยี่สิบในช่วงลดราคาระยะเวลาจำกัด และ open weights — ภายใต้สัญญาอนุญาต MIT — ถูกนำขึ้น Hugging Face ในวันเดียวกัน ต่างจาก GLM-5.3 ที่ยังคงรอ weights จนถึงสิ้นเดือน โมเดลนี้คุณสามารถ self-host ได้ในสัปดาห์นี้ ไม่ใช่สัปดาห์หน้า
นี่คือฉบับย่อ: Zhipu เปิดซอร์สโมเดลขนาดใหญ่ที่ถูกที่สุดเท่าที่เคยมีมา โดยโมเดลนี้เอาชนะ GLM-5.2 ของตัวเองได้ในทุกเกณฑ์ชี้วัด ทั้งที่ใช้พารามิเตอร์ที่ทำงานจริงเพียงเศษเสี้ยว และผู้จำหน่ายให้คะแนนดัชนี Artificial Analysis Intelligence อยู่ที่ 57 — เท่ากับ Claude Opus 4.8 ตามเอกสารเปิดตัวของ Zhipu ตัวเลขเกณฑ์ชี้วัดทุกรายการที่มาพร้อมกับการเปิดตัวครั้งนี้เป็นข้อมูลที่ผู้จำหน่ายรายงานและยังไม่มีการตรวจสอบซ้ำ ณ เวลาที่เขียน ส่วนราคาและจำนวนพารามิเตอร์เป็นข้อเท็จจริงในปัจจุบัน
สิ่งที่ส่งมอบจริง
GLM-5.3-Flash เป็น MoE ที่มีพารามิเตอร์รวม 320B / ใช้งานจริง 18B และมี 45 เลเยอร์ ซึ่งทำให้พารามิเตอร์ที่ใช้งานจริงอยู่ที่มากกว่าครึ่งหนึ่งเล็กน้อยของ ~32B ของ GLM-5.2 ความสามารถหลักคือโมดาลิตี้: รองรับอินพุตทั้งข้อความ รูปภาพ และวิดีโอโดยตรง — เป็นโมเดล GLM-5 รุ่นแรกที่ทำเช่นนี้ — แทนที่จะส่งต่อข้อมูลภาพผ่านอะแดปเตอร์แยกต่างหาก บริบทรองรับได้ถึง 1 ล้านโทเคน และ Zhipu อ้างว่าต้นทุนการให้บริการบริบทยาวอยู่ที่ประมาณหนึ่งในสามของ GLM-5.3
ในด้านสถาปัตยกรรม Zhipu อธิบายว่าเป็นโมเดลฟรอนเทียร์โอเพนซอร์สตัวแรกที่ใช้การออกแบบไฮบริดแบบ sparse-attention ร่วมกับ linear-attention ควบคู่กับ Manifold-Constrained Hyper-Connections (mHC) สำหรับการขยายสเกล และกลไก IndexPool ที่บีบอัดเวกเตอร์คีย์ของตัวจัดทำดัชนีสี่ตัวให้เป็นพูลถ่วงน้ำหนักหนึ่งพูลเพื่อลดความหน่วงของบริบทยาว การฝึกพรีเทรนนิ่งใช้คลังข้อมูลมัลติโมดัลขนาด 30 ล้านล้านโทเคน ทั้งหมดนี้ยังไม่ผ่านการตรวจสอบโดยอิสระ — เป็นเพียงคำอธิบายของ Zhipu เกี่ยวกับโมเดลของตนเอง — แต่ข้อกล่าวอ้างเรื่องประสิทธิภาพการให้บริการนั้นมีความเฉพาะเจาะจงพอที่จะทดสอบได้เมื่อน้ำหนักโมเดลถูกนำไปใช้กับสแตกอินference โอเพนซอร์ส
เอกสารข้อมูลจำเพาะในวันเปิดตัว มองปราดเดียวก็รู้เรื่อง:
• พารามิเตอร์ — รวม 320B / ใช้งาน 18B, 45 เลเยอร์, MoE
• รูปแบบ — รองรับการป้อนข้อมูลข้อความ รูปภาพ และวิดีโอโดยตรง; ผลลัพธ์เป็นข้อความ
• หน้าต่างบริบท — สูงสุด 1,000,000 โทเคน
• ใบอนุญาต — MIT, โอเพนเวตอยู่บน Hugging Face เมื่อเปิดตัว
• ราคา — $0.15 / $0.50 ต่อล้านโทเคน (อินพุต / เอาต์พุต), $0.03 ต่อล้านอินพุตที่แคช; โปรโมชันลด 50% จนถึงวันที่ 9 กันยายน 2026 ลดเหลือ $0.075 / $0.25 / $0.015 เมื่อเทียบกับราคาปกติแล้ว คิดเป็นประมาณหนึ่งในสิบของ $1.40 / $4.40 ของ GLM-5.3

สัปดาห์ Ox Alpha
การเปิดเผยนี้ปิดฉากการคาดเดามาหนึ่งสัปดาห์ เมื่อวันที่ 20 สิงหาคม โมเดลนิรนามปรากฏบนแพลตฟอร์ม AI API ของบุคคลที่สาม โดยมีหน้าต่างบริบท 1 ล้านโทเคน รองรับอินพุตข้อความ/ภาพ/วิดีโอ และราคาเป็นศูนย์ และมันก็กลายเป็นโมเดลที่ถูกเรียกใช้มากที่สุดบนชาร์ตรายสัปดาห์ของแพลตฟอร์มอย่างรวดเร็ว ชุมชนนักพัฒนาสืบย้อนกลับไปได้ว่ามันเป็นตระกูล GLM ของ Zhipu ภายใน 48 ชั่วโมง — ซึ่งเป็นรูปแบบการเปิดตัวแบบไม่เปิดเผยชื่อแล้วค่อยอ้างสิทธิ์แบบเดียวกับที่เคยใช้ระบุโมเดลจากห้องปฏิบัติการจีนอื่น ๆ — และนักวิเคราะห์ส่วนใหญ่คาดเดาว่ามันคือ GLM-5.3 รุ่น Flash การประกาศเมื่อวันที่ 26 สิงหาคมยืนยันการคาดเดาดังกล่าว และเพิ่มรายละเอียดว่าสัปดาห์ที่ให้ใช้ฟรีเป็นการทดสอบโดยเจตนา: Zhipu กล่าวว่าการใช้งานแบบไม่เปิดเผยชื่อนั้นสร้างสถิติปริมาณการเรียกใช้บนแพลตฟอร์มการเขียนโค้ดที่มีให้บริการ โดยการรับส่งข้อมูลทั้งหมดให้บริการผ่านชิปของจีนในประเทศ
บริบทของสัปดาห์ฟรีนั้นสำคัญต่อความคาดหวังด้านราคา โมเดลที่แจกให้ใช้ฟรีที่ $0 เป็นเวลาหนึ่งสัปดาห์ แล้วเปิดตัวในราคาหนึ่งในสิบของเรือธง พร้อมส่วนลดหนึ่งในยี่สิบแบบจำกัดเวลา ถือเป็นการเคลื่อนไหวเชิงกลยุทธ์ในการสร้างตลาดในกลุ่มราคาประหยัด — และคำว่า "จำกัดเวลา" คือส่วนที่ต้องจับตามอง ส่วนลดคือการตัดสินใจด้านราคาที่สามารถถอนกลับได้ แต่น้ำหนักเปิดแบบ MIT นั้นถอนกลับไม่ได้

มีค่าใช้จ่ายเท่าไรในหน่วยดอลลาร์จริง
การ์ดอัตราค่าบริการของ Zhipu ออกมาเป็นเงินดอลลาร์จริง ไม่ใช่แค่อัตราส่วน: $0.15 ต่อล้านโทเคนนำเข้า, $0.50 ต่อล้านโทเคนส่งออก และ $0.03 ต่อล้านโทเคนนำเข้าที่แคชไว้ เมื่อเทียบกับราคาที่เผยแพร่ของ GLM-5.3 ที่ $1.40 / $4.40 ราคานี้ตกอยู่ที่ประมาณหนึ่งในสิบของราคาปกติ และโปรโมชันเปิดตัวลด 50% ซึ่งมีไปจนถึงวันที่ 9 กันยายน 2026 ทำให้ราคาเหลือ $0.075 / $0.25 / $0.015 — ประมาณหนึ่งในยี่สิบ Zhipu ยังระบุต้นทุนต่องาน AA Intelligence Index ของโมเดลไว้ที่ประมาณ $0.045 ตามที่ผู้ขายรายงาน ซึ่งเป็นตัวเลขที่อยู่เบื้องหลังการกล่าวอ้างว่า "1/40 ของ Opus 4.8" สำหรับโมเดลที่ให้คะแนนอยู่ในระดับเดียวกับโมเดลที่มีราคาสูงกว่า 10–40 เท่า ตัวเลขทางเศรษฐกิจที่พาดหัวนั้นเป็นจริง แต่อักษรเล็กคือ ส่วนลดเปิดตัวเป็นเพียงชั่วคราว และต้นทุนต่องานขึ้นอยู่กับว่าโมเดลจะสร้างเอาต์พุตได้มากแค่ไหนเมื่อนำไปใช้งานจริง
{{1}}เรื่องราวด้านประสิทธิภาพคือสิ่งที่ Zhipu อ้างว่าเป็นที่มาของความได้เปรียบด้านต้นทุน{{/1}} {{2}}เมื่อเทียบกับ GLM-5.3 ผู้ผลิตรายงานว่าการคำนวณแอตเทนชัน (attention compute) ลดลง 3.0 เท่า และ KV cache ลดลง 4.4 เท่า พร้อมอ้างว่ามีการคำนวณแอตเทนชันต่ำที่สุดในบรรดาโมเดลระดับประหยัดที่นำมาเปรียบเทียบ ได้แก่ GLM-5.3, DeepSeek V4 Flash และ Kimi K3 — ขณะเดียวกันก็ยอมรับว่า KV cache ของตนยังใหญ่กว่าของ DeepSeek V4 Flash และ Kimi K3 อยู่เล็กน้อย{{/2}} {{3}}ในด้านการให้บริการ (serving) Zhipu รายงานว่าประสิทธิภาพการให้บริการแบบ end-to-end ดีขึ้น 3 เท่าเมื่อเทียบกับเกณฑ์อ้างอิงบนชิปจีนที่ผลิตในประเทศ จนถึงระดับต้นทุนต่อโทเคน (per-token cost) ที่บริษัทระบุว่าเทียบเคียงได้กับ GPU NVIDIA กระแสหลัก{{/3}} {{4}}ทั้งหมดนี้เป็นตัวเลขที่ผู้ผลิตเป็นฝ่ายรายงานเอง และยังไม่มีการทำซ้ำผลการทดลองอย่างอิสระ นี่คือตัวเลขที่เหมาะสมสำหรับการตรวจสอบเทียบกับน้ำหนักแบบเปิด (open weights){{/4}}
ทำไมการเปิดเผยจึงสำคัญ
ต่อให้ไม่นับเรื่อง benchmark การเปิดตัวครั้งนี้ก็ยังเปลี่ยนภูมิทัศน์ของ open model อยู่สองทาง ประการแรก มันคือโมเดลมัลติโมดัลแบบ open-weights ในระดับแนวหน้า (frontier) ในราคาที่จับต้องได้ — การรวมกันของสัญญาอนุญาต MIT คอนเท็กซ์ 1M การรองรับอินพุตรูปภาพ/วิดีโอแบบ native และต้นทุนต่องานเพียงไม่กี่เซนต์ ไม่มีคู่เทียบโดยตรงจากห้องแล็บชั้นนำของสหรัฐฯ ซึ่งโมเดลมัลติโมดัลที่เทียบเท่ากันมีต้นทุนสูงกว่าเป็นสิบเท่าและเผยแพร่ในรูปแบบปิด ประการที่สอง มันตีตลาดรุ่นเรือธงของ Zhipu เอง: GLM-5.3 คือโมเดลขนาด 743B ที่ได้คะแนน 60 จากการวัดอย่างอิสระบนดัชนี AA Intelligence Index ในเดือนนี้ และ GLM-5.3-Flash ถูกวางตำแหน่งเป็น "frontier intelligence, flash cost" ในตระกูลเดียวกัน แนวคิดของ Zhipu คือ โมเดลที่เล็กกว่าและถูกกว่าสามารถดึงความสามารถส่วนใหญ่ของรุ่นเรือธงมาไว้ได้ — ซึ่งหากข้อกล่าวอ้างด้านการเขียนโค้ดและการทำงานแบบ agentic ของผู้พัฒนายังคงเป็นจริง ก็คือข้อโต้แย้งเรื่อง post-training economy แบบเดียวกับที่วงการอุตสาหกรรมวนเวียนพูดถึงมาทั้งปี
ข้อควรระวังหนึ่งข้อช่วยให้เราเห็นเรื่องนี้ในมุมที่เหมาะสม คะแนน AA Index ของ GLM-5.3-Flash ที่ได้ 57 มาจากเอกสารเปิดตัวของ Zhipu เอง ยังไม่ได้มาจากกระดานผู้นำ Artificial Analysis และการเปรียบเทียบด้านการเขียนโค้ดกับ Claude Opus 4.8 เป็นการประเมินจาก Z.ai Code Bench ภายในของ Zhipu จงถือว่าคะแนน 57 และความเท่าเทียมด้านการเขียนโค้ดเป็นเพียงคำกล่าวอ้างจนกว่าจะมีการวัดผลโดยอิสระ — โมเดลนี้ถูกทดสอบอย่างแพร่หลายโดยไม่เปิดเผยตัวตน ดังนั้นตัวเลขจากบุคคลที่สามน่าจะออกมาในไม่ช้า
ลองดูสิ และชั้นการกำหนดเส้นทางเข้ากันได้อย่างไร
การเข้าถึงตั้งแต่วันแรกทำได้ผ่าน API ของ Zhipu เอง, น้ำหนักโมเดลแบบเปิดบน Hugging Face (zai-org/GLM-5.3-Flash, MIT), และผลิตภัณฑ์สำหรับนักพัฒนาของ Zhipu — ZCode และ GLM Coding Plan ซึ่งรวมถึงการ์ดประสบการณ์รายวันจำนวนหนึ่ง สำหรับการโฮสต์ด้วยตัวเอง ใบอนุญาต MIT บวกกับการรองรับ vLLM และ SGLang หมายความว่าข้ออ้างเรื่องประสิทธิภาพการให้บริการข้างต้นสามารถตรวจสอบได้โดยตรง
ในฝั่งการจัดเส้นทาง (routing) ตัว GLM-5.3-Flash เองยังไม่ได้อยู่ในรายชื่อของ OrcaRouter ณ อัปเดตนี้ ส่วนที่เหลือของตระกูล GLM มีดังนี้: GLM-5.3 เปิดให้ใช้งานฝั่งเราในวันเดียวกับที่ API ของ Zhipu เปิดให้บริการ โดยใช้ราคาตามรายการของ Zhipu และบวกมาร์กอัป 0% การส่งผ่านราคาแบบนี้คือกลไกที่สำคัญพอ ๆ กับการเปิดตัวครั้งนี้ — การเปลี่ยนแปลงราคาจากผู้ให้บริการ ไม่ว่าส่วนลดจะยังคงอยู่หรืออัตราค่าบริการจะปรับเปลี่ยนทีหลัง จะแสดงผลฝั่งเราในวันเดียวกัน โดยไม่ต้องเจรจาใหม่ หากคุณต้องการรัน Flash เทียบกับโมเดล GLM ตัวอื่น ๆ ด้วยคีย์เดียวเมื่อมันพร้อมใช้งาน นั่นคือสิ่งที่ต้องตั้งค่า แต่จนกว่าจะถึงตอนนั้น น้ำหนักโมเดลบน Hugging Face คือวิธีที่เร็วที่สุดที่จะทดสอบด้วยตัวเอง

สิ่งที่ควรดูต่อไป
สามสิ่งจะไขความจริงของเรื่องนี้ในอีกสองสามสัปดาห์ข้างหน้า ประการแรก การวัดผลอย่างอิสระของ Artificial Analysis สำหรับโมเดล 57 — โมเดลดังกล่าวถูกใช้งานจริงในโลกแล้วในชื่อ Ox Alpha ดังนั้นลีดเดอร์บอร์ดน่าจะตามมาทันอย่างรวดเร็ว ประการที่สอง โปรโมชันลด 50% — ซึ่งปัจจุบันกำหนดสิ้นสุดในวันที่ 9 กันยายน 2026 — จะถูกขยายออกไปเกินวันดังกล่าวหรือไม่ เพราะเป็นตัวกำหนดต้นทุนระยะยาวของ Flash ประการที่สาม น้ำหนักของ GLM-5.3 ซึ่งยังคงมีคำมั่นว่าจะปล่อยประมาณวันที่ 28 สิงหาคม — สัปดาห์เดียวกับที่น้ำหนัก MIT ของ Flash เปิดตัว ซึ่งจะทำให้ชุมชนโอเพนเวตส์ได้เปรียบเทียบสองระดับของตระกูลเดียวกันในคราวเดียว
การเปรียบเทียบในบทความนี้3
ตรวจพบจากบทความนี้ · เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
