
Ox Alpha เผยโฉม: Z.AI ปล่อยเป็น Open-Weight ในชื่อ GLM-5.3-Flash
- openaiใหม่OpenAI: GPT-6.1 Sol2026-09-2952ความฉลาด
- anthropicใหม่Anthropic: Claude Sonnet 5.52026-09-2856ความฉลาด
- typesafeใหม่TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 ต่อ 1 ล้านโทเค็น · 144 tok/s
- OpenAIใหม่OpenAI: GPT-6 Luna2026-09-2238ความฉลาด
- OpenAIใหม่OpenAI: GPT-6 Sol2026-09-2248ความฉลาด
- Anthropicใหม่Anthropic: Claude Opus 5.52026-09-2258ความฉลาด
- xAIใหม่Grok 4.72026-09-2146ความฉลาด
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 ต่อ 1 ล้านโทเค็น · 126 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 ต่อ 1 ล้านโทเค็น · 933 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040ความฉลาด
- OpenAIOpenAI: GPT-6 Astra2026-09-0453ความฉลาด77การเขียนโค้ด
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241ความฉลาด76การเขียนโค้ด
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245ความฉลาด76การเขียนโค้ด
- AnthropicAnthropic: Claude Fable 5.12026-09-0153ความฉลาด82การเขียนโค้ด
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 ต่อ 1 ล้านโทเค็น · 50 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น · 106 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642ความฉลาด72การเขียนโค้ด
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 ต่อ 1 ล้านโทเค็น · 217 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845ความฉลาด75การเขียนโค้ด
- obsidianQwen3.8 27B2026-08-1534ความฉลาด68การเขียนโค้ด
ในเย็นวันพุธที่ 26 สิงหาคม ปริศนาจบลงอย่างที่นิติเวชคาดการณ์ไว้ Z.AI — ห้องแล็บในกรุงปักกิ่งที่อยู่เบื้องหลังซีรีส์ GLM — ปล่อยโมเดลที่มันทดสอบภายใต้หน้ากากในฐานะผลิตภัณฑ์โอเพนเวตออกมา ในชื่อ GLM-5.3-Flash ซึ่งเป็นชื่อย่อยที่การตรวจพิสูจน์ด้วยโทเคนและตลาดคาดการณ์ต่างมุ่งไปที่เดียวกัน. Ox Alpha โมเดลนิรนามที่ครองชาร์ตการใช้งานสูงสุดนับตั้งแต่ปรากฏตัวเมื่อวันที่ 20 สิงหาคม ตอนนี้เป็นโมเดลที่เผยแพร่และโฮสต์เองได้: ใบอนุญาต MIT, พารามิเตอร์รวม 320B โดยมีพารามิเตอร์ทำงาน 18B ต่อโทเคน, คอนเทกซ์วินโดว์ 1,048,576 โทเคน และการรับเข้าข้อความ/รูปภาพ/วิดีโอตามที่ประกาศในลิสต์ติ้ง รวมถึงน้ำหนักโมเดลบน Hugging Face การเปิดเผยครั้งนี้ยังตอบปริศนาที่ใหญ่ที่สุดของสัปดาห์นิรนาม — โมเดลที่ไม่มีใครเป็นเจ้าของเคลื่อนย้าย 100 ล้านล้านโทเคนต่อวันได้อย่างไร: Z.AI กล่าวว่าการให้บริการทำงานบนชิป AI ในประเทศจีนประมาณ 100,000 ตัวทั้งหมด นับเป็นครั้งแรกที่ซิลิคอนจีนรองรับทราฟฟิกระดับโลกในระดับแนวหน้า ความสามารถนี้ยังก่อให้เกิดการคาดเดาผิดที่ได้รับความนิยมมากที่สุดในสัปดาห์ — ในขนาดนั้น ผู้สังเกตการณ์จำนวนมากซึ่งได้รับแรงสนับสนุนจากโพสต์ปริศนาของนักวิจัย Google DeepMind แย้งว่า Ox Alpha ต้องเป็น Gemini ที่รันบนฮาร์ดแวร์ NVIDIA การเปิดเผยนี้ก็แก้ความเข้าใจผิดนั้นด้วย ในคืนเดียวกัน Alibaba ปล่อย Qwen3.8-Flash-Next โอเพนเวตพรีวิวของสถาปัตยกรรม Qwen4 — ในเย็นวันเดียว มีโอเพนเวตระดับแนวหน้าสองตัวจากแล็บจีน การปล่อยนิรนามสี่ครั้งก่อน Ox Alpha ในที่สุดทั้งหมดถูกอ้างสิทธิ์โดยแล็บจีน: ของ Zhipu AI GLM-5, ของ Xiaomi MiMo-V2-Pro, ของ Ant Group Lingxi Ling-2.6-flash, และของ Meituan LongCat-2.0. Ox Alpha ไม่ใช่การทดลองเฉพาะแพลตฟอร์มอีกต่อไป มันคือโมเดลที่นักพัฒนาสามารถโฮสต์เองได้
ทุกตัวเลขในบทความนี้เป็นข้อกล่าวอ้างของผู้ให้บริการเอง ข้อมูลจากรายการของแพลตฟอร์มเอง ประกาศสาธารณะ หรือการตรวจสอบลายนิ้วมือโดยชุมชน ตัวเลข DeepSWE เป็นผลการวัดของชุมชนโดย Ben Davis นักวิจัยอิสระ — การรันครบ 113 งาน ไม่ใช่การลงแข่งในลีดเดอร์บอร์ดอย่างเป็นทางการ — แม้ว่าตัวเลข ~63% นี้จะใกล้เคียงกับคะแนน DeepSWE v1.1 ที่ 63.4 ซึ่ง Z.AI รายงานเองในฐานะผู้จำหน่าย คำถามเรื่องตัวตนได้ข้อสรุปแล้ว: เมื่อวันที่ 26 สิงหาคม Z.AI ปล่อย Ox Alpha เป็นโมเดลแบบเปิดน้ำหนักภายใต้ชื่อ GLM-5.3-Flash — สัญญาอนุญาต MIT พารามิเตอร์รวม 320B โดยทำงาน 18B — ยืนยันชื่อย่อยที่การวิเคราะห์เชิงนิติวิทยาศาสตร์จาก tokenizer และตัวเข้ารหัสวิดีโอได้พุ่งเป้าไปที่ สถาปัตยกรรม จำนวนพารามิเตอร์ และราคาได้รับการเผยแพร่โดยบริษัทแล้ว สิ่งที่ยังเป็นเพียงการระบุโดยผู้จำหน่าย ไม่ใช่การตรวจสอบโดยอิสระ คือชุดการวัดประสิทธิภาพและข้อกล่าวอ้างของ Z.AI ที่ว่าการให้บริการในสัปดาห์ที่ไม่เปิดเผยชื่อรันบนชิป AI ของจีนในประเทศประมาณ 100,000 ตัว ด้วยต้นทุนต่อโทเคนที่เทียบเคียงได้กับฮาร์ดแวร์ NVIDIA กระแสหลัก — เป็นข้อกล่าวอ้างของบริษัทที่สื่อหลายสำนักนำไปกล่าวซ้ำแล้ว ไม่ใช่ตัวเลขที่ผ่านการตรวจสอบ สมมติฐาน Gemini ในช่วงแรก — ซึ่งความจุ 100 ล้านล้านโทเคนต่อวันเป็นจุดกำเนิด และโพสต์คลุมเครือจากนักวิจัย Google DeepMind เป็นตัวเสริม — นั้นผิด และการปล่อยโมเดลก็ยุติข้อสงสัยได้ คะแนนคุณภาพที่ให้เครดิตแก่นักวิเคราะห์ teortaxesTex — และข้อเสนอแนะของเขาที่ว่า Ox Alpha ที่ผ่านการฝึกเพิ่มเติมอาจเป็นตัวหลักสำหรับ GLM 5.5 ที่แข็งแกร่งกว่า — เป็นเพียงการประเมินของนักวิเคราะห์รายนั้นจากโพสต์ในโซเชียล ไม่ใช่การวัดโดยอิสระหรือคำแถลงของ Zhipu เดโมแอนิเมชันวนลูปที่อธิบายไว้ด้านล่างก็เป็นรายงานจากชุมชนเช่นกัน — โพสต์ของนักพัฒนารายหนึ่งบน X ที่มีการกล่าวถึงต่อในฟอรัมนักพัฒนาของจีน — ไม่ใช่ข้อกล่าวอ้างด้านความสามารถของผู้จำหน่าย และผู้ให้บริการไม่ได้ประกาศฟีเจอร์ดังกล่าว
สิ่งที่เรารู้ — และสิ่งที่เราไม่รู้
เวอร์ชันรวดเร็ว:
ผู้ดำเนินการอธิบายว่า Ox Alpha คือ "โมเดลระดับแนวหน้าที่สร้างขึ้นเพื่อการเขียนโค้ดอย่างมีประสิทธิภาพ การทำงานแบบเอเจนต์ที่ต่อเนื่อง และการใช้งานจริงในสายการผลิต" — โมเดลเชิงเหตุผลที่ออกแบบมาสำหรับวิศวกรรมซอฟต์แวร์ระยะยาวและเวิร์กโฟลว์ที่ผสมผสานข้อความกับบริบททางภาพ
• มีหน้าต่างบริบท 1,048,576 โทเคน (1M) ขีดจำกัดเอาต์พุต 131,072 โทเคน และรองรับอินพุตแบบข้อความ รูปภาพ และวิดีโอ — ถือเป็นการเผยแพร่แบบไม่ระบุชื่อครั้งแรกที่โฆษณารองรับอินพุตวิดีโอ และเป็นความสามารถที่ GLM-5.3-Flash ยืนยันว่าเป็นความสามารถดั้งเดิม ไม่ใช่การเสริมทีหลัง
มันฟรีเป็นเวลาหนึ่งสัปดาห์: $0 ต่อล้านโทเค็นทั้งขาเข้าและขาออก โดยผู้ให้บริการอ้างว่า "อัตราจำกัดที่เอื้อเฟื้อ, การใช้งานที่แทบไม่จำกัด" และความสามารถในการให้บริการ 100 ล้านล้านโทเค็นต่อวัน — ความสามารถที่การเปิดเผยในภายหลังจะบอกว่าได้รับการจัดเตรียมบนชิปจีนภายในประเทศประมาณ 100,000 ตัว
• ยืนยันแล้ว: เมื่อวันที่ 26 สิงหาคม Z.AI ได้เปิดตัว Ox Alpha เป็นโมเดลแบบเปิดน้ำหนัก (open-weight) ภายใต้ชื่อ GLM-5.3-Flash — ใช้สัญญาอนุญาต MIT มีพารามิเตอร์รวม 320B โดยทำงาน 18B — ซึ่งตรงกับที่ sub-name tokenizer, video-encoder, การตรวจสอบรหัสข้อผิดพลาด (error-code forensics) และตลาดการคาดการณ์ได้ข้อสรุปตรงกัน นักวิเคราะห์อิสระ teortaxesTex ประเมินว่ามันอยู่ที่ระดับประมาณเดียวกับ GLM-5.3 หากไม่นับในส่วนของ vision และแนะนำว่า Ox Alpha ที่ผ่านการฝึกเพิ่มเติมอาจเป็นตัวขับเคลื่อนหลักของ GLM 5.5 ที่แข็งแกร่งกว่ามาก
• การอ่านแบบแฟลช-มัลติโมดัลตอนนี้มีเดโมรองรับแล้ว: เมื่อถูกขอให้สร้างอนิเมชันวนลูปของนกกระทุงขี่จักรยานและเปิดโทรศัพท์ที่เล่นอนิเมชันเดียวกัน Ox Alpha ตอบกลับด้วยอนิเมชันวนลูปที่สมบูรณ์ในตัวเองเป็นไฟล์ HTML/SVG ไฟล์เดียว — เป็นเดโมจากชุมชน ไม่ใช่คำกล่าวอ้างจากผู้จำหน่าย
ข้อมูลกิจกรรมในช่วงแรกบนแพลตฟอร์มแสดงให้เห็นการรับส่งข้อมูลการผลิตจริงแล้ว รวมถึงเอเจนต์เขียนโค้ดจาก Nous Research และโปรแกรมแก้ไข Zed
• บริษัทได้เปิดตัวแล้ว — เมื่อวันที่ 26 สิงหาคม Z.AI ได้เปิดตัว Ox Alpha ในชื่อ GLM-5.3-Flash แบบ open-weight ภายใต้สัญญาอนุญาต MIT ซึ่งยุติคำถามเกี่ยวกับตัวตน ข้อมูลจำเพาะ และราคาในคราวเดียว: 320B พารามิเตอร์ทั้งหมด โดยมี 18B ที่ทำงานอยู่ รองรับมัลติโมดัลโดยกำเนิด ด้วยราคาที่กำหนดโดย Z.AI ที่ $0.15 ขาเข้า / $0.50 ขาออก ต่อล้านโทเคน และโปรโมชั่นเปิดตัวลด 50% ที่ระบุว่าจะมีถึงเพียง 9 กันยายน — ซึ่งปัจจุบันผ่านมาแปดวันแล้ว โดยอัตราที่ลดแล้วยังคงเป็นอัตราที่ให้บริการอยู่ Z.AI ยังเปิดเผยว่าการให้บริการในสัปดาห์นิรนามที่ 100T โทเคนต่อวันนั้นทำงานบนชิปจีนในประเทศประมาณ 100,000 ชิป ซึ่งเป็นครั้งแรกในระดับนั้น สิ่งที่การเปิดเผยครั้งนี้ไม่ได้รวมไว้คือการวัดประสิทธิภาพแบบอิสระ — คะแนนของโมเดลนั้นรายงานโดยผู้ขาย — ดังนั้นตัวเลขอิสระที่เป็นตัวแทนมากที่สุดยังคงเป็นผลการรัน DeepSWE 113 งานเต็มรูปแบบของ Ben Davis ที่ประมาณ 63% ซึ่งอยู่ในระดับเดียวกับ GPT-5.6 Sol mid
Ox Alpha คืออะไร
คำอธิบายบนแพลตฟอร์มระบุถึง Ox Alpha ว่าเป็น "โมเดลการให้เหตุผลที่ออกแบบมาสำหรับการเขียนโค้ด งานแบบเอเจนต์ที่ต่อเนื่อง และเวิร์กโหลดระดับโปรดักชัน — วิศวกรรมซอฟต์แวร์ระยะยาว การให้เหตุผลที่ซับซ้อน และเวิร์กโฟลว์ที่ผสมผสานข้อความเข้ากับบริบทภาพ" นั่นคือการวางตำแหน่งที่เฉพาะเจาะจง: มันถูกสร้างขึ้นสำหรับลูปการทำงานของเอเจนต์ที่ยาวนานและการเขียนโค้ด ไม่ใช่สำหรับการแชททั่วไป บริบท 1M คือสิ่งที่บ่งบอกได้ชัด — พื้นที่มากพอสำหรับเซสชันเอเจนต์ที่กินเวลาหลายชั่วโมงหรือที่เก็บโค้ดขนาดใหญ่ — และขีดจำกัดเอาต์พุต 131K ทำให้สามารถสร้างผลลัพธ์ยาวๆ ได้ในครั้งเดียว มันรองรับการเรียกใช้เครื่องมือและฟังก์ชัน รวมถึงเอาต์พุต JSON แบบมีโครงสร้าง ซึ่งเป็นส่วนที่เหลือของเช็กลิสต์สำหรับการทำงานแบบเอเจนต์

การรับข้อมูลวิดีโอเป็นคุณสมบัติที่โดดเด่นที่สุดในเอกสารข้อมูลจำเพาะ ไม่มีโมเดลนิรนามรุ่นก่อนหน้าใดโฆษณาฟีเจอร์นี้ และโมเดลที่สามารถรับเฟรมวิดีโอรวมถึงข้อความและรูปภาพนั้นถูกออกแบบมาสำหรับงานอีกประเภทหนึ่ง ซึ่งแตกต่างจากโมเดลที่ปรับแต่งสำหรับการแชทที่ออกมาก่อนหน้านี้ นอกจากนี้ ตามที่การตรวจสอบทางนิติวิทยาศาสตร์จะเผยให้เห็นในภายหลัง มันยังเป็นหนึ่งในตัวบ่งชี้เอกลักษณ์ที่แข็งแกร่งที่สุดที่โมเดลหนึ่งๆ จะมีได้ ทั้งหมดนี้ — คำอธิบาย ข้อมูลจำเพาะ ตัวเลขความเร็ว — มาจากผู้ให้บริการและรายการบนแพลตฟอร์ม การเปิดตัว GLM-5.3-Flash ยืนยันข้อมูลจำเพาะหลัก (320B-A18B, native multimodal) ส่วนตัวเลขความเร็วและความจุยังคงเป็นการอ้างสิทธิ์จากผู้จำหน่าย
เรื่องราวของมัลติโมดัลได้ตัวอย่างที่เป็นรูปธรรมในสัปดาห์นี้ นักพัฒนา Chetaslua — ซึ่งการตรวจสอบฝั่งเซิร์ฟเวอร์ของเขาเป็นส่วนหนึ่งของเส้นทางลายนิ้วมือ — ได้โพสต์การทดสอบที่เขาขอให้ Ox Alpha สร้างลูปของนกกระทุงขี่จักรยานและเปิดโทรศัพท์ที่เล่นแอนิเมชันเดียวกันซ้ำ: ลูปอ้างอิงตัวเองภายในลูป รายงานของเขาระบุว่าโมเดลสร้างแอนิเมชัน HTML/SVG ไฟล์เดียว — นกกระทุงที่มีขาสองท่อนที่ถีบจักรยานได้จริง ความเร็วล้อสอดคล้องกับความเร็วพื้น พื้นหลังแบบพารัลแลกซ์ และส่วนที่โทรศัพท์อยู่ในลูป ฟอรัมนักพัฒนาชาวจีนแยกกันทดสอบพรอมป์นกกระทุงขี่จักรยานและหารือเกี่ยวกับผลลัพธ์ ดังนั้นเดโมนี่ไม่ใช่การอ้างเดี่ยวที่พิสูจน์ไม่ได้ เนื่องจากผลลัพธ์เป็นโค้ด จึงสอดคล้องกับสเปกของแพลตฟอร์มที่ส่งออกเป็นข้อความเท่านั้น: ความเข้าใจแบบมัลติโมดัลและการสร้างโค้ดเชิงสร้างสรรค์ทำงานร่วมกัน ไม่ใช่การสังเคราะห์วิดีโอแบบเนทีฟ บทสรุปของ Chetaslua — ว่านี่คือผลตอบแทนของมัลติโมดัล และโมเดลโอเพนซอร์สที่มีความสามารถจะมาพร้อมกับมัน — เป็นการคาดการณ์ของเขาเอง ไม่ใช่คำแถลงจากผู้จำหน่าย; ผู้ให้บริการยังไม่ได้ประกาศอะไร
ข้อเสนอฟรีหนึ่งสัปดาห์
การโปรโมตครั้งนี้ดุดันมาก ฟรีตลอดสัปดาห์ที่จัด พร้อมข้อความว่า "อัตราจำกัดแบบใจกว้าง ใช้งานได้แทบไม่จำกัด" และอ้างความจุ 100 ล้านล้านโทเคนต่อวัน โดยมีหมายเหตุจากผู้ให้บริการเชิญชวนผู้ใช้ให้ "ดูสิว่าคุณทำอะไรได้บ้าง" หากตีความตามตัวเลข 100T โทเคนต่อวันจะทำให้ผู้ให้บริการรายนี้อยู่ในกลุ่มผู้ให้บริการอินฟาเรนซ์ที่ใหญ่ที่สุดในโลก — ข้ออ้างนี้ฟังดูไม่เหมือนสเปก แต่เหมือนการท้าทายให้ทดสอบความเครียด ซึ่งสอดคล้องกับรูปแบบที่มีอยู่: การปล่อยแบบไม่เปิดเผยชื่อเป็นวิธีที่ห้องแล็บจะได้รับทราฟฟิกจริงระดับแนวหน้าโดยไม่ต้องเอาชื่อไปติดไว้ที่หน้าประตู การอ่านที่ยืนยันแล้วทำให้ข้ออ้างเรื่องขนาดเป็นรูปธรรม ไม่ใช่แค่ทำให้ฟังดูเข้าท่า: Z.AI เปิดเผยว่าเซิร์ฟวิ่ง 100T โทเคนต่อวันทำงานบนชิป AI ในประเทศจีนประมาณ 100,000 ตัว — เป็นครั้งแรกที่การปล่อยระดับแนวหน้าถูกเสิร์ฟในขนาดนั้นโดยไม่ใช้ฮาร์ดแวร์ของ NVIDIA การเปิดเผยดังกล่าวยังคงเป็นคำกล่าวอ้างของบริษัท ซึ่งตอนนี้มีสำนักข่าวหลายแห่งนำไปรายงานซ้ำ แต่ยังไม่มีการตรวจสอบโดยอิสระ และยังมีคำกล่าวอ้างจากผู้จำหน่ายที่เบากว่าอีกข้อหนึ่ง: Z.AI ระบุว่าต้นทุนต่อโทเคนบนคลัสเตอร์ในประเทศนั้นเทียบเท่ากับ GPU กระแสหลักของ NVIDIA
อีกด้านของ "ฟรีหนึ่งสัปดาห์" คือราคาที่ตามมาหลังจากนั้นไม่เป็นที่รู้กัน — การเปิดเผยได้ตอบคำถามนั้น ราคาตั้งที่ Z.AI เผยแพร่สำหรับ GLM-5.3-Flash คือ $0.15 ต่อล้านโทเค็นอินพุต, $0.50 ต่อล้านโทเค็นเอาต์พุต และ $0.03 ต่อล้านโทเค็นอินพุตที่แคชไว้ โปรโมชันเปิดตัวลด 50% มีการระบุว่าจะดำเนินไปจนถึงวันที่ 9 กันยายน 2026 โดยลดราคานั้นเหลือ $0.075 / $0.25 แปดวันหลังจากวันนั้น อัตราที่ลดแล้วยังคงเป็นอัตราที่ให้บริการอยู่: เมื่ออ่านซ้ำในวันที่ 17 กันยายน 2026 หน้าของโมเดล z-ai/glm-5.3-flash ระบุราคาอินพุตที่ $0.075 เอาต์พุตที่ $0.25 และการอ่านแคชที่ $0.0173 ต่อล้านโทเค็น โดยไม่มีป้ายโปรโมชันใดๆ เมื่อเทียบกับราคาตั้งของ GLM-5.3 ที่ $1.40 / $4.40 นั่นคิดเป็นประมาณหนึ่งในยี่สิบ ผลในทางปฏิบัติคือวันที่สิ้นสุด 9 กันยายนนั้นล้าสมัยมากกว่าจะมีผลผูกมัด — นักพัฒนาที่จัดงบประมาณโดยอิง $0.15 / $0.50 กำลังจัดงบบนตัวเลขที่ปัจจุบันไม่มีใครถูกเรียกเก็บ สิ่งที่หน้าราคาไม่ได้ให้คำตอบคือเหตุผล รายการโมเดลของ Z.AI เองยังคงระบุ $0.15 / $0.50 สำหรับ GLM-5.3-Flash ดังนั้นไม่ว่าโปรโมชันจะถูกขยายออกไป ทำให้เป็นถาวร หรือเพียงปล่อยให้ดำเนินต่อไป ก็ไม่ใช่สิ่งที่เราหาแหล่งอ้างอิงได้ อัตราที่ลดแล้วคือข้อเท็จจริงที่สังเกตได้ ณ วันที่นี้ และสาเหตุยังคงเปิดอยู่
การวัดประสิทธิภาพเต็มรูปแบบครั้งแรก — และมันทำผลงานได้เทียบเท่ากับ GPT-5.6 Sol mid
Ox Alpha ยังไม่มีรายชื่อในแทร็กเกอร์อิสระอย่าง Artificial Analysis หรือ LMArena — คำว่า "frontier" เป็นคำเรียกของผู้ให้บริการเอง และตัวเลขเบนช์มาร์กที่ Z.AI เผยแพร่พร้อมกับการเปิดตัว GLM-5.3-Flash (DeepSWE v1.1 63.4, AutomationBench 48.8, Artificial Analysis Intelligence Index 57) เป็นตัวเลขที่ผู้จำหน่ายรายงาน ไม่ใช่คะแนนจากการวัดอิสระ สิ่งที่เปลี่ยนไปตั้งแต่เปิดตัวคือตัวเลขที่ชุมชนวัดเริ่มเผยแพร่ออกมา — และภาพรวมก็เริ่มชัดเจนขึ้น บน Kingbench การรันช่วงแรกให้ Ox Alpha อยู่ที่ 87.5 ต่ำกว่า GLM-5.3 ที่ 91.25 เล็กน้อย บน DeepSWE นักวิจัยอิสระ เบน เดวิส เริ่มด้วยการรันชุดย่อย 10 งานและรายงาน Pass@1 ที่ 80% นำหน้า Claude Fable 5 (65%), GLM-5.3 และ Grok 4.6 (62%) และ GPT-5.6 Sol (52%) หลังจากนั้นเขารันครบทั้งชุด DeepSWE ทั้งหมด 113 งาน และผลลัพธ์ที่ปรับแก้แล้วอยู่ที่ประมาณ 63% — พอๆ กับ GPT-5.6 Sol mid ตัวเลข 80% จากชุดย่อยเป็นตัวที่สะดุดตา แต่ 10 งานคิดเป็นไม่ถึง 9% ของเบนช์มาร์กทั้งหมด เดวิสเองก็ชี้ว่าตัวเลขจากชุดเต็มคือตัวที่ "สมเหตุสมผลกว่ามาก" ตัวเลขเหล่านี้เป็นการวัดโดยชุมชน ไม่ใช่เบนช์มาร์กของผู้จำหน่ายและไม่ใช่คะแนนลีดเดอร์บอร์ดอย่างเป็นทางการ — แต่ผลการรันเต็มชุดคือตัวเลขที่เป็นตัวแทนมากที่สุดเท่าที่ใครจะได้จากโมเดลนี้ และตอนนี้มันสอดคล้องใกล้เคียงกับคะแนน DeepSWE v1.1 ที่ Z.AI รายงานเองที่ 63.4 — เป็นการตรวจสอบข้ามที่มีประโยชน์ แม้ว่าตัวเลขของบริษัทจะเป็นการอ้างมากกว่าการวัดก็ตาม
การเปรียบเทียบหนึ่งรายการมีความสำคัญมากขึ้น ณ ตอนนี้ เมื่อเทียบกับตอนที่เปิดตัวครั้งแรก DeepSeek V4 Pro 0813 — บิลด์ GA ของเรือธงของ DeepSeek ที่วางจำหน่ายเมื่อวันที่ 13 สิงหาคม — รายงานค่า DeepSWE ที่ 62.7 บนการ์ดเบนช์มาร์กของ DeepSeek เอง เทียบกับ 12.8 จาก DeepSeek V4 Pro Preview รุ่นก่อนหน้า ตัวเลขทั้งสองเป็นค่าที่ผู้ผลิตเป็นผู้รายงาน และยังไม่มีห้องปฏิบัติการอิสระรายใดพิสูจน์ซ้ำ ณ เวลาที่เขียนบทความนี้ เมื่อพิจารณาร่วมกับผลการรันชุดเต็มของชุมชนสำหรับ GLM-5.3-Flash ที่ ~63% และค่า DeepSWE v1.1 ของ Z.AI เองที่ 63.4 แล้ว คะแนน 62.7 ของ DeepSeek ทำให้ข้ออ้างของเอเจนต์เขียนโค้ดจีนที่รู้จักกันดีที่สุดสองรายตกอยู่ในช่วง 60 ต้นๆ เช่นเดียวกัน ส่วนต่างสิบคะแนนซึ่งดูเหมือนเป็นจุดขายของ Ox Alpha นั้นวัดเทียบกับ DeepSeek V4 Flash 0731 ซึ่งเป็นโมเดลเล็กที่ราคาถูกกว่า แต่เมื่อเทียบกับเรือธงของ DeepSeek แล้ว GLM-5.3-Flash กลับเสมอกัน ไม่ได้นำห่างสิบคะแนน
อีกบทเรียนหนึ่งคือเรื่องของตัวเลขตัวมันเอง นักวิเคราะห์ teortaxesTex — ผู้ที่ติดตามค่าประมาณเหล่านี้มาตั้งแต่อาทิตย์ที่ไม่เปิดเผยชื่อ — ตั้งข้อสังเกตว่ารายงานแรกเกี่ยวกับ Ox Alpha ก็ให้ผล DeepSWE 80% เช่นกัน นั่นคือชุดย่อย 10 งานอันสะดุดตาของ Davis และผลลัพธ์สุดท้ายบนชุดเต็ม 113 งานกลับอยู่ที่ 63% เมื่อ DeepSeek V4 Pro 0813 ทำ 62.7 อย่างเป็นทางการในย่านเดียวกัน ข้อสังเกตของเขาคือยังไม่มีอะไรเข้าใกล้การทำ 80% ที่ทำซ้ำได้อย่างสมเหตุสมผลได้จริง — ตัวเลข 80% ยังคงปรากฏขึ้นในช่วงต้นของชีวิตสาธารณะของโมเดล แล้วก็ลงเอยที่ช่วง 60 ต้น ๆ ทุกครั้งเมื่อมีการรันชุดเต็ม นั่นคือการอ่านเชิงวิเคราะห์ของเขา ไม่ใช่การวัดผล แต่มันคือเลนส์ที่ถูกต้องสำหรับพาดหัว DeepSWE ครั้งถัดไป รวมถึงหัวข้อใด ๆ เกี่ยวกับ GLM-5.3-Flash เอง

นอกจากนี้ยังมีเรื่องของการใช้งาน ข้อมูลกิจกรรมบนแพลตฟอร์มแสดงให้เห็นทราฟฟิกการใช้งานจริงภายในไม่กี่ชั่วโมงแรก — รวมถึง Hermes Agent โครงการเขียนโค้ดแบบเอเจนต์จาก Nous Research และโปรแกรมแก้ไขโค้ด Zed ทั้งสองอย่างคือกรณีการใช้งานแบบ “งานเอเจนต์ต่อเนื่องและการเขียนโค้ด” ที่โมเดลนี้ถูกวางตำแหน่งไว้พอดี มันไม่ใช่คะแนน แต่เป็นสัญญาณ: นักพัฒนาที่มีงานจริงตัดสินใจว่าการเดิมพันที่ฟรี ระดับแนวหน้า และไม่เปิดเผยตัวตนนั้นคุ้มค่าที่จะนำมาต่อเชื่อม ก่อนที่ผลรัน DeepSWE เต็มรูปแบบจะออกมา การยอมรับจากผู้ใช้ช่วงแรกนั้นคือหลักฐานเดียวที่มี ตัวเลข ~63% ของชุดเต็มในตอนนี้จึงให้จุดยึดเกณฑ์มาตรฐานแก่โมเดลเพื่อใช้ชั่งน้ำหนักเทียบกับสิ่งนั้น
รายละเอียดปลีกย่อยของการเก็บรักษาข้อมูล
การประกาศทดลองใช้ฟรีหนึ่งสัปดาห์โฆษณาโอ้อวดว่า "ไม่มีการเก็บข้อมูลใดๆ" แต่รายละเอียดของโมเดลที่แสดงบนแพลตฟอร์มกลับเล่าเรื่องที่มีเงื่อนไขมากกว่า: พรอมป์และผลลัพธ์ถูกเก็บไว้โดยผู้ให้บริการแต่ไม่ได้นำไปใช้ฝึกโมเดล ภายใต้ข้อกำหนดโมเดลซ่อนเร้นของแพลตฟอร์ม ความแตกต่างนี้สำคัญหากคุณกำลังจะวางโค้ดลับทางการค้าลงในหน้าต่างความจุ 1 ล้านโทเคน ซึ่งเป็นของผู้ให้บริการที่ไม่เปิดเผยตัวจนกระทั่ง Z.AI ออกมาเปิดเผยตัวเมื่อวันที่ 26 สิงหาคม จงถือว่า "ไม่มีการเก็บข้อมูลใดๆ" เป็นแค่การตลาดจนกว่า Z.AI จะเผยแพร่ข้อกำหนดที่ระบุชัดเจนเช่นนั้น — และส่งข้อมูลใดก็ตามที่คุณไม่ต้องการให้ถูกบันทึกผ่านโมเดลแยกต่างหากที่ระบุตัวตนได้
คู่มือโมเดลนิรนาม
Ox Alpha คือผลงานแบบนิรนามชิ้นที่ห้าในรอบหกเดือน และสี่ชิ้นก่อนหน้านี้ก็คลี่คลายในแบบเดียวกัน นั่นคือ การเปิดตัวโดยไม่เปิดเผยตัวตน กระแสทราฟฟิกที่พุ่งเข้ามาเอง จากนั้นก็มีบริษัทออกมาแสดงตัว:
• Pony Alpha (กุมภาพันธ์ 2026) — Zhipu AI ยืนยันประมาณห้าวันหลังจากการเปิดตัวว่าเป็น GLM-5 โมเดลเรือธง MoE ที่มีพารามิเตอร์ 744B
• Hunter Alpha (11 มีนาคม) — โมเดลฟรีที่มีพารามิเตอร์ล้านล้านตัวพร้อมบริบท 1M กลายเป็นเรื่องที่ถูกคาดเดากันตลอดฤดูใบไม้ผลิ ถูกคาดเดากันอย่างกว้างขวางว่าเป็น DeepSeek V4; ถูกเปิดเผยว่าเป็น MiMo-V2-Pro ของ Xiaomi โดยมี Healer Alpha คู่หูถูกระบุว่าเป็น MiMo-V2-Omni
• Elephant Alpha (เมษายน) — โมเดลข้อความฟรีที่เน้นประสิทธิภาพ ซึ่ง Ant Group อ้างสิทธิ์ว่าเป็น Lingxi Ling-2.6-flash ประมาณสองสัปดาห์หลังจากที่มันปรากฏ
• Owl Alpha (ปลายเดือนเมษายน) — โมเดลที่มุ่งเน้นเอเจนต์พร้อมการเรียกใช้เครื่องมือแบบเนทีฟและบริบท ~1M ซึ่ง Meituan ยืนยันว่าเป็น LongCat-2.0 เมื่อวันที่ 30 มิถุนายน ซึ่งเป็นโมเดลพารามิเตอร์ล้านล้านตัวแรกที่ฝึกและให้บริการบนชิปจีนในประเทศทั้งหมด
• Ox Alpha (20 สิงหาคม) — เปิดเผยเมื่อวันที่ 26 สิงหาคมว่าเป็น GLM-5.3-Flash ซึ่งเป็นโมเดล open-weight ที่ได้รับอนุญาตภายใต้ MIT ขนาด 320B-A18B; ตัวตน ใบอนุญาต และสเปกทั้งหมดเป็นทางการในวันเดียวกับที่เปิดเผย

ทำไมต้องเปิดตัวโมเดลที่ดีโดยซ่อนไว้หลังหน้ากาก? การอ่านมาตรฐาน ซึ่งวงจร Hunter Alpha ทำให้เป็นรูปธรรม คือ การไม่เปิดเผยตัวตนจะขจัดอคติของแบรนด์จากการประเมิน และการใช้งานฟรีจะรวบรวมข้อมูลการประเมินในโลกจริงในระดับแนวหน้า ในขณะที่ทุกคนเถียงกันเรื่องเจ้าของโมเดล ตามที่บทวิเคราะห์หนึ่งของรูปแบบนี้กล่าวไว้ว่า "การไม่มีแบรนด์คือการตลาด" ข้อดีเพิ่มเติมคือความเร็ว: โมเดลที่ไม่ระบุชื่อสามารถเข้าถึงนักพัฒนาทั่วโลกได้ภายในไม่กี่ชั่วโมงโดยไม่ต้องมีงานเปิดตัว และความลึกลับนั้นเองก็กลายเป็นการกระจายตัว
Ox Alpha คือใคร?
ก่อนการเปิดตัวในวันที่ 26 สิงหาคม ไม่มีบริษัทใดอ้างสิทธิ์ในโมเดลนี้ และ Zhipu AI ก็ไม่ได้พูดอะไร — แต่สถานการณ์หลักฐานชิ้นสำคัญกลับเปลี่ยนไปภายใน 48 ชั่วโมงหลังการเปิดตัวโมเดล และหลักฐานทางนิติเวชด้านล่างนี้คือเหตุผลที่การเปิดเผย — ในชื่อ GLM-5.3-Flash — จึงไม่สร้างความประหลาดใจมากนัก ตัวเลขความจุในตอนแรกดูจะขัดกับหลักฐาน: 100 ล้านล้านโทเคนต่อวันดูเหมือนลายเซ็นของแล็บระดับแนวหน้าบนซิลิกอนของ NVIDIA และทฤษฎีที่ว่า Ox Alpha คือ Gemini ตัวใหม่ — ซึ่งได้รับการสนับสนุนจากโพสต์ลึกลับของนักวิจัย Google DeepMind — มีแรงผลักดันจริงจัง จนกระทั่งหลักฐานจาก tokenizer และการเปิดตัวของ Z.AI เองมาปิดคดี สัญญาณที่แข็งแกร่งที่สุดคือ tokenizer เครื่องมือลายนิ้วมือที่สร้างโดยชุมชนชื่อ modelprint ตรวจสอบโครงสร้างพื้นฐานของ Ox Alpha เก้ารายการ และพบว่ามันตรงกับ GLM-5.3 ของ Z.ai ถึงหกรายการ โดยจำนวน tokenizer ที่ปรับมาตรฐานทั้งสี่รายการตรงกับตระกูล GLM ในขณะที่ตัวเลือกที่ดีที่สุดที่ไม่ใช่ GLM ทำได้เพียงสองในสี่ นักวิจัยอิสระ Ben Davis รายงานว่าจำนวนโทเคนของ Ox Alpha ตรงกับ GLM-5.3 อย่างแม่นยำใน 25 คำสั่งทดสอบ โดยมีความต่างคงที่เพียง +75 โทเคน ซึ่งเขาเชื่อว่าเกิดจาก wrapper ที่ซ่อนอยู่ การจับคู่ tokenizer เป็นสัญญาณพิสูจน์ตัวตนที่ปลอมแปลงได้ยากที่สุด — โมเดลไม่สามารถเปลี่ยนวิธีแบ่งข้อความได้หากไม่ได้รับการฝึกใหม่
เส้นทางวิดีโอเป็นลายเซ็นที่สอง การใช้โทเคนวิดีโอของ Ox Alpha ตรงกับ GLM-5V-Turbo ทุกประการในตัวอย่างควบคุม 4 ตัวอย่าง — ซึ่งมีกลไกการสุ่มเฟรม การปรับขนาดระยะเวลา และความละเอียดแบบเดียวกัน — ในขณะที่ MiMo v2.5, Qwen 3.8 Max และ GLM-4.6V ล้วนแยกออกไปคนละทาง นั่นเป็นสัญญาณที่ชัดเจน: การจัดการวิดีโอฝังลึกอยู่ในตัวโมเดล ไม่ใช่สิ่งที่ติดตั้งเพิ่มภายหลัง ชุดลายนิ้วมือที่เหลือก็สอดคล้องกับการอ่านค่านี้: Ox Alpha ปฏิเสธอินพุตเสียงในแบบที่ GLM-5V ทำ ใช้รหัสข้อผิดพลาด "1301" อันเป็นลักษณะเฉพาะของ GLM เหมือนกัน ให้สไตล์ผลลัพธ์ที่คล้ายกัน (ประมาณ 1.3 อีโมจิต่อ 1,000 ตัวอักษร) มีการกำหนดค่าพารามิเตอร์และ API ที่ถูกจำกัดแบบเดียวกัน ซึ่งปรากฏในรายการ GLM-5.3 บนแพลตฟอร์มสองวันก่อนที่ Ox Alpha จะเปิดตัว และมีจุดตัดความรู้ (knowledge cutoff) ใกล้เดือนพฤศจิกายน 2025
การระบุที่มานี้มีแบบอย่างอยู่ในแผนการของ Zhipu เอง: Pony Alpha โมเดลนิรนามที่เปิดตัวในเดือนกุมภาพันธ์ ถูกระบุว่าคือ GLM-5 ประมาณห้าวันหลังเปิดตัว การตีความของนักวิเคราะห์ที่แพร่สะพัดในสัปดาห์นี้ — ว่า Ox Alpha คือ GLM-5.3 ซึ่งน่าจะเป็นโมเดล Flash — มี Pliny the Liberator กล่าวย้ำ โดยเขาระบุว่าเอเยนต์ของเขายืนยันว่า "Ox-alpha มาจาก Zai ในตระกูล GLM-5.X" นักวิเคราะห์อิสระ teortaxesTex ให้การประเมินด้านคุณภาพในทิศทางเดียวกัน และเพิ่มข้ออ้างด้านเวลา: เขาจัดอันดับ Ox Alpha ไว้ที่ระดับประมาณ GLM-5.3 หากไม่นับด้านวิทัศน์ และพบว่าจุดที่น่าทึ่งที่สุดคือการเปลี่ยนผ่านที่รวดเร็ว — คือการบีบอัด GLM-5.3 แบบข้อความอย่างเดียว แล้วส่งออกพร้อมวิทัศน์ที่ใช้งานได้ภายในไม่กี่วันหลังเปิดตัวเมื่อวันที่ 14 สิงหาคม นั่นคือการประเมินของนักวิเคราะห์คนหนึ่ง ไม่ใช่คะแนนจากการประเมินอิสระ และเขาโต้แย้งว่านี่ควรทำให้หยุดคิดกับเรื่องเล่าที่ว่า "จีนปล่อยโมเดลแบบสดๆ ร้อนๆ" โพสต์ล่าสุดของเขาซ้อนการคาดเดาเรื่องโรดแมปลงบนข้อสรุปนั้น: วงจรอัปเดต GLM-5 อาจสั้น; Ox Alpha ใกล้เคียงกับ GLM-5.3 มากจนการใช้เป็นซับเอเยนต์แทบไม่สมเหตุสมผล — "แค่รัน ox @4 แทน" คือคำพูดแบบย่อของเขาที่หมายถึงการรันโมเดลโดยตรง; และ Ox Alpha ที่ผ่านการเทรนเพิ่มเติมจะสมเหตุสมผลอย่างมากในการเป็นม้างาน ตามคำพูดของเขาคือ "สัตว์ใช้งาน" สำหรับ GLM 5.5 ที่แข็งแกร่งกว่ามาก นั่นคือการคาดเดาของนักวิเคราะห์คนหนึ่งเกี่ยวกับโรดแมป ไม่ใช่คำแถลงจาก Zhipu ในทางกลับกัน ปัญหาเรื่องชื่อรุ่นย่อยได้ข้อสรุปแล้ว: เมื่อวันที่ 26 สิงหาคม Z.AI เปิดตัว Ox Alpha ในชื่อ GLM-5.3-Flash ข้อติดขัดที่เคยทำให้ป้าย Flash ยังคงเป็นเพียง "ข้อสันนิษฐาน" — GLM-5.3 เปิดตัวเมื่อวันที่ 14 สิงหาคมในฐานะโมเดลข้อความอย่างเดียว ขณะที่ Ox Alpha โฆษณารองรับวิดีโออินพุต — คือสิ่งที่การเปิดตัวครั้งนี้ไขข้อสงสัยได้พอดี: GLM-5.3-Flash เป็นโมเดลมัลติโมดัลโดยกำเนิดที่แตกต่างออกไป ไม่ใช่โมเดลข้อความอย่างเดียวตัวเดิม ทฤษฎีทางเลือกอื่น ๆ — ทีม MiMo ของ Xiaomi, DeepSeek — ถูกหยิบยกขึ้นมาและถูกตัดออกไปเป็นส่วนใหญ่ด้วยหลักฐานด้านโทเคนไนเซอร์และวิดีโอ และการเปิดตัวครั้งนี้ยุติคำถามเรื่องตระกูลโมเดลอย่างเด็ดขาดข้อโต้แย้งของ Davis ที่ว่าทำไมต้องสนใจป้าย Flash กลับกลายเป็นเหตุผลเชิงปฏิบัติ: เพราะ Ox Alpha คือ GLM-5.3-Flash จริง ๆ ซึ่งทำงานที่ระดับกลางของ GPT-5.6 Sol มันจึงสามารถรันในเครื่องได้แล้ว — น้ำหนักโมเดลถูกเผยแพร่บน Hugging Face และ SGLang, vLLM และ TokenSpeed สามารถให้บริการได้ — ซึ่งเปลี่ยนโมเดลเขียนโค้ดระดับกลางในกลุ่มแนวหน้าให้เป็นค่าใช้จ่ายฮาร์ดแวร์ครั้งเดียว แทนที่จะเป็นค่าใช้จ่ายต่อโทเคน สำหรับใครก็ตามที่ยินดีโฮสต์มัน
กรอบเชิงภูมิรัฐศาสตร์เป็นของนักวิเคราะห์ ไม่ใช่ของหลักฐาน: "สิ่งนี้เพิ่มแรงกดดันมหาศาลยิ่งขึ้นต่อ US Frontier Labs และช่องว่างกับจีนกำลังแคบลง" นั่นคือการตีความว่าโมเดลระดับ Zhipu แบบเปิดที่ทำงานในระดับแนวหน้ามีความหมายอย่างไรต่อระเบียบการแข่งขัน — และการเปิดเผยข้อมูลฮาร์ดแวร์ทำให้ได้เปรียบที่นักวิเคราะห์ไม่มี การให้บริการ 100 ล้านล้านโทเคนต่อวันบนชิปในประเทศประมาณ 100,000 ตัว คือการสาธิตขนาดใหญ่ครั้งแรกที่แสดงให้เห็นว่าสแตกของจีนที่ปราศจากซิลิคอนของ NVIDIA สามารถรองรับปริมาณงานอินเฟอเรนซ์ระดับแนวหน้าได้ — สถานการณ์ที่เจนเซิน หวง ซีอีโอของ NVIDIA เตือนไว้ในพอดแคสต์ Dwarkesh เมื่อฤดูใบไม้ผลิที่ผ่านมา เมื่อเขากล่าวว่ามาตรการควบคุมการส่งออกจะเร่งให้จีนสร้างสแตกที่พึ่งพาตนเองได้โดยไม่ต้องใช้ NVIDIA และโมเดลระดับแนวหน้าที่ทำงานได้ดีที่สุดบนฮาร์ดแวร์จีนในประเทศจะเป็น "ผลลัพธ์ที่เลวร้าย" สำหรับสหรัฐอเมริกา ตัวเลขความเท่าเทียมด้านต้นทุนของ Z.AI ยังคงเป็นการกล่าวอ้างจากผู้จำหน่าย แต่ตัวเหตุการณ์เองเป็นเรื่องจริง เย็นวันเดียวกันยังทำให้ประเด็นนี้เป็นรูปธรรมในฝั่งโมเดลด้วย เนื่องจาก Z.AI ปล่อย GLM-5.3-Flash ขณะที่ Alibaba เปิดตัว Qwen3.8-Flash-Next ซึ่งเป็นตัวอย่างโอเพนเวทของสถาปัตยกรรม Qwen4 การปล่อยโมเดลโอเพนเวทระดับแนวหน้าของจีนสองรุ่นในคืนเดียว คือรูปธรรมของสิ่งที่ผู้สังเกตการณ์เรียกว่า "วันสำคัญของโอเพนซอร์สจีน"
สัปดาห์นี้คุณควรสร้างบนมันไหม
สัปดาห์ฟรีสิ้นสุดลงแล้ว แต่การทดสอบยังคงราคาถูก: อัตราที่เรียกเก็บจริงในวันที่ 17 กันยายน คือ $0.075 ขาเข้า / $0.25 ขาออก ต่อล้านโทเค็น ไม่ใช่ราคาที่ตั้งไว้ $0.15 / $0.50 — โปรโมชั่นเปิดตัวลด 50% ที่ระบุว่าจะสิ้นสุดในวันที่ 9 กันยายน ยังคงมีผลอยู่แม้จะผ่านไปแปดวันแล้ว หากคุณทำงานแบบ agentic ที่มีขอบเขตยาว เขียนโค้ดบนบริบทขนาดยาว หรือรันไปป์ไลน์ที่เน้นวิดีโอ นั่นคือจุดตัดที่ Ox Alpha ถูกวางตำแหน่งไว้พอดี — และเมื่อน้ำหนักโมเดลเปิด คุณสามารถรันการทดสอบบนฮาร์ดแวร์ของคุณเองได้ แทนที่จะต้องขอความอนุเคราะห์จากแพลตฟอร์มนิรนาม ข้อควรระวังสองประการ ประการแรก ป้าย 'frontier' ยังคงเป็นเพียงคำกล่าวอ้าง: สกอร์การ์ดของ GLM-5.3-Flash เป็นการรายงานโดยผู้ขาย และตัวเลขอิสระที่มั่นคงเพียงตัวเดียว — การรัน DeepSWE ของ Davis ที่ ~63% — นั้นแข็งแกร่งแต่ยังห่างไกลจาก 80% ที่กลายเป็นไวรัลของชุดงาน 10 งานในช่วงแรก ประการที่สอง ราคา $0 ถูกจำกัดเวลา และการเปิดตัวได้กำหนดราคาของสิ่งที่ตามมา — ถูกสำหรับความสามารถ แต่ไม่ฟรีอีกต่อไป สิ่งที่การเปิดตัวแบบ open-weight ขจัดออกไปคือการพึ่งพา: ไฟล์ถูกเปิดเผยออกมาแล้ว ดังนั้นโมเดลจึงสามารถโฮสต์เองได้แทนที่จะเช่า นั่นคือรูปร่างของการทดสอบ ไม่ใช่การพึ่งพา
วิธีที่ปลอดภัยสำหรับโปรดักชันในการรันเทสต์แบบนั้นคือ fallback chain: โมเดลทดลองจะตอบเมื่อมันทำงานปกติ และคำขอจะถูกส่งต่อไปยังโมเดลที่พิสูจน์แล้วทันทีที่มันค้าง เกิดข้อผิดพลาด หรือหายไป นั่นคือหน้าที่ของ routing layer การเปิดเผยนี้ทำให้การเลือก fallback เป็นเรื่องง่ายมาก: Ox Alpha คือ GLM-5.3-Flash และตัวโมเดลเองก็ใช้งานได้จริงบน OrcaRouter ภายใต้ชื่อจริงของมันในราคา $0.075 ขาเข้า / $0.25 ขาออก ต่อล้านโทเคน โดยการอ่านจากแคชอยู่ที่ $0.0173 — อัตราเปิดตัวลด 50% ที่ระบุว่าจะสิ้นสุดวันที่ 9 กันยายน และ ณ วันที่ 17 กันยายน ยังคงเป็นราคาบนหน้าเว็บ ไม่ใช่ราคาตามรายการ $0.15 / $0.50 มันถูกส่งผ่านโดยมีมาร์กอัป 0% ใช้ API เดียวครอบคลุม 200+ โมเดล พร้อม failover อัตโนมัติ เพื่อให้ทราฟฟิกพุ่งช่วงสัปดาห์เปิดตัวไม่กลายเป็นระบบล่มของคุณ ลองออดิชันโมเดลใหม่ไว้ข้างหน้า โดยมี fallback ที่พิสูจน์แล้วอยู่ข้างหลังในห่วงโซ่; เมื่อราคาเปลี่ยน ตัวเลขที่คุณเห็นบน OrcaRouter คือตัวเลขที่คุณจ่ายในวันเดียวกัน หรือข้าม API ไปเลย — น้ำหนักโมเดลเป็นโอเพนซอร์ส ดังนั้นการโฮสต์ GLM-5.3-Flash เองไว้หลังห่วงโซ่เดียวกันก็เป็นทางเลือกที่เป็นไปได้เช่นกัน
ดูอะไรดี
หกสิ่งจะบอกส่วนที่เหลือของเรื่องราว เกณฑ์วัดอิสระ: สกอร์การ์ดของ GLM-5.3-Flash เป็นข้อมูลที่ผู้ขายรายงานเอง การรัน DeepSWE ของ Davis ที่ราว 63% เป็นตัวเลขอิสระที่น่าเชื่อถือเพียงตัวเดียวจนถึงตอนนี้ คะแนนอย่างเป็นทางการ 62.7 ของ DeepSeek V4 Pro 0813 ตอนนี้อยู่ในช่วงเดียวกัน และรายการใน Artificial Analysis หรือ LMArena — หรือการเทียบแบบตัวต่อตัวโดยอิสระ — จะเป็นการตรวจสอบขั้นสุดท้ายว่าคำว่า “frontier” เป็นข้อเท็จจริงหรือเป็นเพียงคำโปรย เส้นทางราคา: คำถามในสภาวะคงตัวมีคำตอบจากหลักฐานเท่าที่มีจนถึงตอนนี้ — โปรโมชัน 50% ถูกระบุว่าจะสิ้นสุดวันที่ 9 กันยายน แต่ในวันที่ 17 กันยายน อัตราที่ลดแล้ว $0.075 / $0.25 ยังคงเป็นอัตราที่ให้บริการอยู่ ดังนั้นตัวเลขโปรโมชัน ไม่ใช่ราคาปลีก $0.15 / $0.50 ที่เป็นตัวเลขสำหรับตั้งงบประมาณ สิ่งที่ยังไม่คลี่คลายคือสาเหตุ เพราะราคาปลีกของ Z.AI เองยังไม่ขยับ ข้ออ้างเรื่องฮาร์ดแวร์: Z.AI กล่าวว่าสัปดาห์นิรนามนั้นรันบนชิปในประเทศราว 100,000 ตัว ด้วยต้นทุนที่เทียบเท่ากับ NVIDIA — การทดสอบสาธารณะครั้งแรกในระดับนั้นคือ ข้ออ้างนี้จะผ่านการตรวจสอบอย่างอิสระหรือไม่ และสแต็กในประเทศจะกลายเป็นค่าเริ่มต้นของสาย GLM หรือไม่ คณิตศาสตร์การนำไปใช้: ทราฟฟิกที่ครองแพลตฟอร์มซึ่ง Ox Alpha ดึงดูดไว้ขณะอยู่ภายใต้หน้ากาก จะแปลงเป็นการติดตั้งแบบโฮสต์เองและการใช้งานผ่าน API หรือไม่ ตอนนี้ที่มันมีชื่อ มีใบอนุญาต และมีราคาแล้ว ภาคต่อ: GLM-5.3-Flash จะทำให้ Ox Alpha เป็นเพียงบันไดขั้นหนึ่งหรือไม่ — คำใบ้ของ teortaxesTex คือเวอร์ชันที่ผ่านการฝึกเพิ่มเติมจะกลายเป็นกำลังหลักให้กับ GLM 5.5 ที่แข็งแกร่งกว่ามาก ซึ่งจะทำให้การเปิดตัวครั้งนี้เป็นรากฐานของ GLM รุ่นถัดไป และปฏิกิริยา: เมื่อ Qwen3.8-Flash-Next เปิดตัวในคืนเดียวกัน และมีเบื้องหลังเป็นการเปิดเผยชิปในประเทศ แรงกดดันจึงอยู่ที่แล็บแนวหน้าของสหรัฐฯ — และต่อการถกเถียงเรื่องการควบคุมการส่งออก — ที่จะต้องตอบ จับตาว่าการตามมาอย่างรวดเร็ว การขยับราคา หรือการตอบสนองเชิงนโยบาย จะเกิดที่อีกฟากของช่องว่างหรือไม่
คำตัดสินที่ตรงไปตรงมา: Ox Alpha เป็นการทดลองที่ถูกอย่างผิดปกติในทั้งสองทิศทาง แพลตฟอร์มทดสอบว่าโมเดลระดับแนวหน้าที่ไม่ระบุตัวตนในราคา $0 จะชนะทราฟฟิกโปรดักชันจริงได้ภายในหนึ่งสัปดาห์หรือไม่ — มันทำได้ อย่างน่าเชื่อถือมากพอที่ Z.AI ไม่เพียงก้าวออกมาในวันที่หก แต่ยังปล่อยน้ำหนักโมเดลเป็นโมเดลเปิดในคืนเดียวกันนั้น คุณได้ทดสอบว่าโมเดลนี้สมควรมีที่ในสแต็กของคุณหรือไม่ ตอนนี้โดยไม่มีความเสี่ยงเรื่องการไม่ระบุตัวตน: GLM-5.3-Flash เป็นโมเดลที่ระบุชื่อ มีสัญญาอนุญาต MIT โฮสต์เองได้ ในราคาที่ประกาศไว้ และคำถามเรื่องฮาร์ดแวร์ก็ได้คำตอบเช่นกัน — Z.AI กล่าวว่าการให้บริการที่ 100T-token/วัน ทำงานบนชิปจีนในประเทศราว 100,000 ชิป ซึ่งบริษัทเป็นผู้ระบุ แต่ขณะนี้มีรายงานกันอย่างแพร่หลาย สิ่งที่ยังต้องเรียนรู้นั้นคือ "แนวหน้า" จะอยู่รอดจากการวัดผลโดยอิสระหรือไม่ ข้ออ้างความเท่าเทียมด้านต้นทุนจากชิปในประเทศของ Z.AI จะยืนหยัดได้ในระดับสเกลหรือไม่ ทำไมโปรโมชันเปิดตัว 50% ยังคงเป็นราคาที่ให้บริการอยู่แปดวันหลังจากวันที่สิ้นสุดที่ระบุไว้คือ 9 กันยายน และการเปิดเผยนี้ทำให้ GLM-5.3-Flash กลายเป็นม้าศึกสำหรับ GLM 5.5 ที่แข็งแกร่งกว่าหรือไม่ ตามที่ teortaxesTex บอกเป็นนัย จงทำการทดลอง แต่จงทำโดยมีทางสำรองคอยรองรับอยู่ข้างใต้
การเปรียบเทียบในบทความนี้4
ตรวจพบจากบทความนี้ · เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
