การ์ดหัวเรื่องหลักสำหรับบทความ 'Ox Alpha' พร้อมคำบรรยายรอง 'หน้าอ้างอิงมาตรฐานสำหรับนามแฝงลับเบื้องหลัง GLM-5.3-Flash ของ Z.ai' ป้ายที่ระบุว่า 'เปิดให้ทดลองก่อนในชื่อ Ox Alpha ตั้งแต่วันที่ 20 สิงหาคม 2026', 'เปิดเผยเมื่อวันที่ 26 สิงหาคม 2026', '320B รวม / 18B ใช้งาน, คอนเท็กซ์ 1M' และ 'สัญญาอนุญาต MIT, น้ำหนักโมเดลแบบเปิด' และบรรทัดส่วนท้ายที่ระบุว่า 'Envelope, โมดัลลิตี้, เรตการ์ด, พื้นผิวเอนด์พอยต์ และ benchmarks - ตรวจสอบยืนยันเมื่อ 2026-09-28' โลโก้ OrcaRouter ถูกนำมาซ้อนรวมไว้ที่มุมขวาล่าง
Guides & Insights

Ox Alpha: สเปกชีตฉบับสมบูรณ์ของโมเดล Stealth ที่ขณะนี้จัดส่งในชื่อ GLM-5.3-Flash

ผู้เขียน

Magnus Corvin

วันที่เผยแพร่

โมเดลล่าสุด · 20ดูโมเดลทั้งหมด →
เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
กลับไปยังโพสต์ทั้งหมด

Ox Alpha เป็นชื่อนิรนามที่ GLM-5.3-Flashถูกเปิดตัวในฐานะตัวอย่าง โดยเปิดเผยเมื่อวันที่ 26 สิงหาคม 2026 และไม่ใช่โมเดลที่คุณเรียกใช้ได้ในวันนี้ รายการตัวอย่างที่ใช้ชื่อ Ox Alpha ไม่ได้ให้บริการภายใต้ชื่อนั้นอีกต่อไป โมเดลที่อยู่เบื้องหลังมีหน้าของผู้จำหน่าย น้ำหนักโมเดลที่ได้รับสัญญาอนุญาตแบบ MIT ตารางราคาที่เผยแพร่ และพื้นผิว API ที่มีเอกสารกำกับ ซึ่งทั้งหมดเป็นของ Z.ai หน้านี้เป็นเอกสารอ้างอิงสำหรับโมเดลนั้น — ขอบเขตความสามารถ รูปแบบข้อมูล (modalities) ตารางราคา พื้นผิวเอนด์พอยต์ ตัวเลข benchmark ที่เผยแพร่ทุกตัวพร้อม revision หรือ harness ที่แนบมาด้วย และเนื่องจากนามแฝงนี้ยังคงให้ผลการค้นหาที่บางเบาและสับสน เราจึงระบุอย่างตรงไปตรงมาว่าสิ่งใดไม่มีเอกสารกำกับไว้ที่ใดเลย ทุกอย่างด้านล่างนี้อ่านเมื่อวันที่ 28 กันยายน 2026 จากเอกสารโมเดลและหน้าตาราคาของ Z.ai เอง จาก model card ของ Z.ai บน Hugging Face จาก Artificial Analysis และจากแค็ตตาล็อกของเราเอง ตัวเลขที่ผู้จำหน่ายเผยแพร่และตัวเลขที่บุคคลที่สามวัดได้จะถูกติดป้ายแยกจากกัน และไม่มีสิ่งใดในนี้ที่อนุมานจากการคล้ายคลึงกัน

ชื่อ Ox Alpha หมายถึงอะไรในปัจจุบัน

นามแฝงนี้ถูกยกเลิกแล้ว และผู้ให้บริการคือผู้ที่ยกเลิกมัน เอกสารของ Z.ai เองสำหรับ GLM-5.3-Flash ระบุว่าโมเดลนี้ถูกทดสอบแบบไม่เปิดเผยชื่อภายใต้ชื่อ ox-alpha ก่อนวางจำหน่าย เพื่อรวบรวมความคิดเห็นจากผู้ใช้ และการทดสอบแบบไม่เปิดเผยชื่อนั้นกลายเป็นโมเดลที่ได้รับความนิยมมากที่สุดของสัปดาห์นั้น จุดอ้างอิงที่ระบุวันที่ได้นั้นสั้นและเจาะจง: รายการแบบ stealth แสดงว่า Ox Alpha เปิดตัวเมื่อวันที่ 20 สิงหาคม 2026 และการเปิดเผยเกิดขึ้นในวันที่ 26 สิงหาคม — วันที่เดียวกับที่หน้าเอกสารของ Z.ai ระบุ และเป็นวันวางจำหน่ายเดียวกับที่แคตตาล็อกของเราบันทึกไว้สำหรับ z-ai/glm-5.3-flash

สองสิ่งตามมาจากเรื่องนั้น และทั้งสองสิ่งล้วนสำคัญต่อผู้อ่านที่ค้นหาชื่อนี้

• นามแฝงไม่ใช่เส้นทาง แค็ตตาล็อกของเราส่งคืน "model not found" สำหรับการค้นหา stealth/ox-alpha ซึ่งอ่านเมื่อ 2026-09-28 ไม่มีอะไรให้เรียกภายใต้ชื่อนั้น เพราะผลิตภัณฑ์ของผู้ขายใช้ชื่อของผู้ขายเอง

• ยังไม่มีที่เก็บเวทของผู้ขายภายใต้นามแฝงนี้เช่นกัน การค้นหา Hugging Face สำหรับ ox-alpha จะได้ผลลัพธ์เป็นอัปโหลดจากชุมชนที่สร้างขึ้นในช่วงเวลาลับปลายเดือนสิงหาคม 2026 บวกกับที่เก็บแบบมีการ์ดเท่านั้นจากวันที่ 27 กันยายน 2026 ซึ่งไม่มีเวทและชี้ไปที่การเปิดตัวอย่างเป็นทางการของ Z.ai ชื่อที่เก็บเป็นเพียงป้ายที่ผู้อัปโหลดเลือกไว้ ไม่ใช่เอกสารยืนยันสิ่งใด องค์กรของ Z.ai เองเผยแพร่โมเดลในชื่อ zai-org/GLM-5.3-Flash โดยที่ที่เก็บถูกสร้างขึ้นเมื่อ 2026-08-25 ตามเวลา UTC

คำถามเรื่องผู้ให้บริการที่ครอบงำสัปดาห์นิรนามได้ปิดลงแล้ว และมันปิดลงในแบบธรรมดา: ห้องแล็บแห่งหนึ่งก้าวออกมาและติดชื่อของตนลงบนโมเดล สิ่งที่เหลืออยู่คือข้อกำหนด ซึ่งเป็นสิ่งที่หน้านี้ครอบคลุม เรื่องราวการค้นพบ — การทำลายนิ้วมือที่มาก่อนการเปิดเผย เชื้อสายของโมเดลนิรนามที่มันเป็นส่วนหนึ่ง และการเปิดเผยฮาร์ดแวร์ที่ใช้ให้บริการที่มาพร้อมกัน — อยู่ในบทความก่อนหน้าของเราเกี่ยวกับการสอบสวน Ox Alpha และหน้านี้ไม่รื้อฟื้นเรื่องใด ๆ เหล่านั้น

ซองจดหมาย ตามที่ผู้ขายระบุไว้ในเอกสาร

A screenshot of Z.ai's official developer documentation page for GLM-5.3-Flash, showing the Model Overview section with the four spec rows on the right reading Input Modality 'Video / Image / Text / File', Output Modality 'Text', Context Length '1M' and Maximum Output Tokens '128K', alongside vendor-stated architecture notes describing 320B total parameters with 18B activated and a hybrid sparse-and-linear attention design that reduces attention computation and KV cache by 3.01x and 4.44x versus GLM-5.3.

นี่คือตัวเลขที่ Z.ai รายงาน ซึ่งอ่านจากหน้าเอกสารของผู้จำหน่ายเองเมื่อวันที่ 28 กันยายน 2026 และสามในสี่มิติของกรอบข้อกำหนดได้รับการยืนยันอย่างเป็นอิสระ — บันทึกโมเดลของ Artificial Analysis ระบุค่าเดียวกันทั้งขนาดรวม 320B, 18B แอ็กทีฟ, บริบท 1,000,000 โทเคน และสัญญาอนุญาต MIT ส่วนการ์ดแค็ตตาล็อกของเราเองก็ระบุขีดจำกัดด้านบริบทและเอาต์พุต

• หน้าต่างบริบท — 1,000,000 โทเค็น (เอกสารประกอบของ Z.ai; Artificial Analysis; การ์ดแค็ตตาล็อกของเราเอง ซึ่งระบุ 1,000,000)

• เอาต์พุตสูงสุด — 128K โทเค็น (เอกสาร Z.ai); การ์ดของเราบันทึกไว้ที่ 128,000

• อินพุต — ข้อความ รูปภาพ วิดีโอ และไฟล์ (เอกสาร Z.ai, อ่านเมื่อ 2026-09-28); การ์ดของเราแสดงรายการข้อความ รูปภาพ และวิดีโอ และไม่ได้อ้างว่ามีอินพุตไฟล์

• ผลลัพธ์ — เฉพาะข้อความ ในทุกแหล่งที่มา

• พารามิเตอร์ — รวม 320B โดยเปิดใช้งาน 18B ต่อโทเคน (เอกสารและโมเดลการ์ดของ Z.ai; Artificial Analysis บันทึกไว้อย่างอิสระที่ 320B และ 18B)

• สัญญาอนุญาต — MIT โดยเผยแพร่เวตบน Hugging Face (การ์ดโมเดลของผู้ขาย; Artificial Analysis จัดประเภทโมเดลนี้เป็นโอเพนเวตภายใต้สัญญาอนุญาตแบบผ่อนปรน)

• สถาปัตยกรรม — ลูกผสมของ attention แบบ sparse และแบบ linear ซึ่ง Z.ai อธิบายว่าเป็นโมเดล frontier แบบโอเพนซอร์สตัวแรกที่รวมทั้งสองแบบเข้าด้วยกัน ลดการคำนวณ attention ลง 3.01× และ KV cache ลง 4.44× เมื่อเทียบกับ GLM-5.3 พร้อมขั้นตอน IndexPool ที่บีบอัดเวกเตอร์คีย์ของ indexer สี่ตัวให้เหลือหนึ่งตัวในบริบทแบบยาว และ Manifold-Constrained Hyper-Connections สำหรับประสิทธิภาพในการขยายขนาด ทั้งหมดนี้เป็นข้อมูลที่ผู้ขายระบุไว้ ไม่มีผลการตรวจสอบสถาปัตยกรรมจากอิสระให้อ้างอิง

• การฝึกอบรมล่วงหน้า — คลังข้อมูลหลายโมดัลขนาด 30 ล้านล้านโทเค็น (ตามที่ Z.ai ระบุ) ผู้พัฒนาไม่เปิดเผยตัวเลขการประมวลผลสำหรับการฝึกอบรมทั้งหมด และไม่เปิดเผยรายละเอียดพารามิเตอร์แยกตามเลเยอร์ นอกเหนือจากตัวเลขหลัก 320B/18B

ข้อกล่าวอ้างเรื่องขอบเขตหนึ่งได้แคบลงนับตั้งแต่เปิดตัว และเอกสารปัจจุบันคือฉบับที่ควรอ้างอิง การเปิดเผยฮาร์ดแวร์สำหรับให้บริการซึ่งเผยแพร่เมื่อเดือนสิงหาคมระบุขีดความสามารถของสัปดาห์ที่ไม่ระบุชื่อไว้ที่ชิปจีนในประเทศประมาณ 100,000 ชิป เอกสารของ Z.ai ที่ปรากฏในปัจจุบันระบุว่าโมเดลนี้ให้บริการ "บนตัวเร่งความเร็วที่พัฒนาขึ้นในประเทศหลายหมื่นตัว" โดยมีการปรับปรุงการให้บริการแบบ end-to-end 3 เท่าเมื่อเทียบกับ baseline ของผู้ขายเองบนฮาร์ดแวร์เดียวกัน และต้นทุนต่อโทเคนที่ผู้ขายอธิบายว่าเทียบได้กับ NVIDIA GPUs กระแสหลัก หลายหมื่นตัวคือสิ่งที่หน้าดังกล่าวระบุตอนนี้ ส่วนตัวเลขที่มากกว่านั้นเป็นตัวเลขในยุคเปิดตัว ทั้งสองเป็นข้อกล่าวอ้างของบริษัท ไม่มีข้อใดผ่านการตรวจสอบอย่างอิสระ และทิศทางของการแก้ไขคือไปในทางลดลง

เรตการ์ด และเหตุใดจำนวนที่เสิร์ฟจริงจึงเป็นสิ่งที่สำคัญ

หน้าราคาของ Z.ai ระบุว่า GLM-5.3-Flash อยู่ที่ $0.15 ต่อโทเค็นอินพุตหนึ่งล้านโทเค็น, $0.03 ต่อโทเค็นอินพุตที่แคชไว้หนึ่งล้านโทเค็น และ $0.50 ต่อโทเค็นเอาต์พุตหนึ่งล้านโทเค็น ส่วนระดับ FlashX ที่เป็นรุ่นพี่น้องกันอยู่ที่ $0.37 / $0.075 / $1.25 นั่นคือราคาตามประกาศของผู้ขาย ซึ่งอ่านจากหน้าเว็บของผู้ขายเองเมื่อวันที่ 28 กันยายน 2026

อัตราที่ให้บริการจริงบนเส้นทางของเราวันนี้ต่ำกว่า และนี่คือประเด็นในทางปฏิบัติของส่วนนี้ เมื่ออ่านเมื่อ 2026-09-28 การ์ด OrcaRouter สำหรับ z-ai/glm-5.3-flash กำหนดราคาอินพุตที่$0.075ต่อล้านโทเค็น เอาต์พุตที่$0.25ต่อล้าน และการอ่านแคชที่$0.0173ต่อล้าน นั่นคือครึ่งหนึ่งของราคาตามรายการของผู้ขาย บนโมเดลเดียวกัน ในวันเดียวกัน — เป็นตัวเลขส่วนลดไม่ใช่ราคาที่พาดหัว โดยไม่มีการติดป้ายโปรโมชันบนการ์ด บทความก่อนหน้าของเราเกี่ยวกับโมเดลนี้สังเกตเห็นช่องว่างเดียวกันหลังจากช่วงโปรโมชันที่ระบุไว้สิ้นสุดลง ข้อสังเกตนี้ยังคงใช้ได้จนถึงวันนี้ และเรายังคงไม่สามารถหาแหล่งที่มาของเหตุผลได้ ดังนั้นเราจึงรายงานตัวเลขที่ให้บริการจริงและปล่อยให้สาเหตุยังคงเปิดอยู่

Cached input คือจุดที่ทั้งสามแหล่งข้อมูลขัดแย้งกันอย่างเห็นได้ชัด ซึ่งเป็นเครื่องเตือนใจที่มีประโยชน์ว่า "$0.03" ในตารางไม่จำเป็นต้องเป็นราคาที่ใครสักคนจ่ายจริง หน้าเว็บของผู้ขายระบุว่า $0.03 ต่อโทเคนอินพุตที่แคชไว้หนึ่งล้านโทเคน บันทึกโมเดลของ Artificial Analysis มีราคาแบบ cache-hit อยู่ที่ $0.026 ขณะที่เส้นทางของเราให้บริการการอ่านแคชที่ $0.0173 ทั้งสามรายการอ่านค่า ณ วันที่ 2026-09-28 หรือก่อนหน้านั้นเล็กน้อย และทั้งสามรายการเป็นข้อมูลที่ผู้ขายหรือแพลตฟอร์มรายงาน เรายกตัวเลขตามรายการของผู้ขายมาแสดงเป็นตัวเลขตามรายการ และตัวเลขที่ให้บริการจริงมาแสดงเป็นสิ่งที่ผู้เรียกใช้ถูกเรียกเก็บจริง

ลองคำนวณกับงานของเอเจนต์ตัวอย่างหนึ่งงาน — โทเคนอินพุต 100,000 และโทเคนเอาต์พุต 10,000 โดยไม่มีแคชฮิต:

• ในอัตราตามรายการของผู้ขาย — 100,000 โทเค็น × $0.15/1M = $0.015 บวก 10,000 × $0.50/1M = $0.005 ดังนั้น $0.020 ต่อการเรียกหนึ่งครั้ง

• ด้วยอัตราที่เส้นทางของเราให้บริการในวันนี้ — $0.0075 บวก $0.0025 ดังนั้น $0.010 ต่อการเรียก ซึ่งเป็นครึ่งหนึ่งพอดี

นั่นคือเหตุผลทั้งหมดที่ต้องตรวจสอบราคาที่ให้บริการจริงแทนที่จะดูราคาตั้งต้น ก่อนที่คุณจะกำหนดขนาดของเวิร์กโหลด เพราะบนเอเจนต์ที่ทำงานระยะยาวซึ่งเรียกใช้งานหลายพันครั้งต่อวัน ความแตกต่างระหว่างตัวเลขสองตัวนั้นก็คือความแตกต่างระหว่างงบประมาณสองก้อน OrcaRouter ส่งผ่านราคาตั้งต้นของผู้ให้บริการโดยบวกเพิ่ม 0% ซึ่งเป็นเหตุผลว่าทำไมส่วนลดที่ผู้ขายจัดโปรโมชันจึงปรากฏบนการ์ดของเรา แทนที่จะถูกกลืนหายไปที่ใดที่หนึ่งในระหว่างทาง

รูปแบบและปลายทาง

ผู้ให้บริการเอกสารระบุรูปแบบอินเทอร์เฟซหนึ่งแบบและรหัสโมเดลสองรหัส ได้แก่ glm-5.3-flash และ glm-5.3-flashx โดยทั้งสองให้บริการผ่าน Chat Completion API รูปภาพจะถูกส่งเข้าไปเป็นบล็อกเนื้อหาประเภท image_url ในอาร์เรย์เนื้อหาของข้อความ โดยรับได้ทั้ง URL — ซึ่งผู้ให้บริการแนะนำ — หรือ data URL แบบ base64 และสามารถส่งบล็อกรูปภาพหลายบล็อกในข้อความเดียวได้ รองรับการสตรีม และ Z.ai แนะนำให้เปิด stream และ tool_stream ควบคู่กันสำหรับคำขอแบบสตรีมมิ่ง การเรียกใช้เครื่องมือ การแคชบริบท และเอาต์พุต JSON แบบมีโครงสร้าง ล้วนเป็นความสามารถที่มีการบันทึกไว้ในเอกสาร ส่วน thinking นั้นรองรับ แต่ดังที่หัวข้อถัดไปอธิบาย มันไม่ใช่ตัวเลือกเสริม

FlashX เป็นระดับการให้บริการที่แยกต่างหากของโมเดลเดียวกัน ไม่ใช่ความสามารถที่แยกต่างหาก โดย Z.ai ระบุไว้ที่ 200 โทเคนต่อวินาที และระบุว่ายังไม่พร้อมให้บริการบน GLM Coding Plan ทั้งนี้ ไม่ใช่ระดับที่แคตตาล็อกของเราให้บริการ และไม่ใช่สิ่งที่ตัวเลขในหน้านี้ระบุไว้

บนเส้นทางของเรา พื้นผิวของเอนด์พอยต์แคบกว่าและควรระบุให้ชัดเจน การ์ดสำหรับ z-ai/glm-5.3-flash เปิดเผย POST /v1/chat/completions — เฉพาะ chat completions เท่านั้น โดยไม่มีเอนด์พอยต์โปรโตคอลที่สอง — และรองรับ reasoning, reasoning_effort, include_reasoning, tools, tool_choice, response_format, stream, temperature, top_p, max_tokens และ stop ชิปความสามารถบนการ์ดคือ vision, tools, JSON และ reasoning คอนเท็กซ์คือ 1,000,000 โทเคน และเอาต์พุตสูงสุด 128,000 ซึ่งตรงกับเอกสารของผู้ให้บริการ

ความพยายามและการคิด: การตั้งค่าที่ตรึงตัวเลข benchmark ทุกตัว

นี่คือส่วนของข้อกำหนดที่เปลี่ยนวิธีที่คุณอ่านคะแนนมากที่สุด และผู้ขายได้จัดทำเอกสารไว้อย่างแม่นยำ GLM-5.3-Flash รับพารามิเตอร์ reasoning_effort ที่มีสามระดับ — low, high และ max — และจะตั้งค่าเริ่มต้นเป็น max หากคุณไม่ส่งอะไรเลย หรือหากคุณส่งอะไรก็ตามที่ไม่ใช่ low หรือ high การคิดไม่สามารถปิดได้: ผู้ขายระบุว่า thinking.type รองรับเฉพาะ enabled เท่านั้น แฟล็ก clear_thinking ของเทมเพลตแชตมีค่าเริ่มต้นเป็น false และ Z.ai แนะนำให้ส่งค่านี้อย่างชัดเจนเป็น true สำหรับสถานการณ์แชต การตั้งค่าการสุ่มตัวอย่างที่ผู้ขายแนะนำคือ temperature 1 และ top_p 0.95 และระบุตรง ๆ ว่าการทำซ้ำผล benchmark และ leaderboard ควรคงค่า max effort ตามค่าเริ่มต้นไว้

พิจารณาข้อเท็จจริงสองข้อนี้ร่วมกัน แล้วผลที่ตามมาสำหรับใครก็ตามที่เปรียบเทียบตัวเลขก็หลีกเลี่ยงไม่ได้: คะแนนที่อ้างโดยไม่ระบุระดับ effort ไม่ใช่การวัดที่สมบูรณ์ เพราะการตั้งค่า low, high และ max เป็นจุดทำงานที่แตกต่างกันของโมเดลเดียวกัน และค่าเริ่มต้นคือค่าที่มีค่าใช้จ่ายสูงที่สุดในสามค่า การ์ดของเราแสดง reasoning และ reasoning_effort ในบรรดาพารามิเตอร์ที่รองรับ ดังนั้นการตั้งค่านี้จึงเข้าถึงได้ผ่านเส้นทาง ไม่ใช่เพียงผ่านผู้ให้บริการเท่านั้น

แผ่นเกณฑ์มาตรฐาน โดยแนบฉบับแก้ไขมาด้วย

Z.ai เผยแพร่ตาราง benchmark สำหรับ GLM-5.3-Flash และข้อมูลทั้งหมดมาจากผู้จำหน่ายเอง — บันทึกข้อมูลอิสระของ Artificial Analysis ไม่ได้ยืนยันแถวข้อมูลเหล่านี้ ตัวเลขด้านการเขียนโค้ดและ agentic ที่เป็นจุดขายของทางผู้จำหน่ายคือ DeepSWE v1.1 อยู่ที่ 63.4 เทียบกับ 46.2 ของ GLM-5.2 และ AutomationBench v1.0.6 อยู่ที่ 48.8 เทียบกับ 26.2 ของ GLM-5.2 ส่วนที่เหลือของตาราง ตามที่แค็ตตาล็อกของเราเองบันทึกไว้โดยระบุ Z.ai เป็นแหล่งที่มา ได้แก่ Humanity's Last Exam แบบใช้เครื่องมือ 55.3, Agents' Last Exam 26.3, NL2Repo 56.3, Chartography แบบใช้เครื่องมือ 78, CharXiv แบบใช้เครื่องมือในการให้เหตุผล 89.4 และในด้าน vision มี MMVU 80.5, MVBench 77.8 และ BabyVision 53.4

สองแถวของผู้ขายสมควรได้รับการนำเชิงอรรถใส่เข้าไปในประโยค เพราะเป็นแถวที่ผู้อ่านมีแนวโน้มจะอ้างถึงโดยไม่มีเชิงอรรถมากที่สุด การประเมินการเขียนโค้ดภายในของ Z.ai ชื่อ Z.ai Code Bench v1.0 จัดให้ GLM-5.3-Flash อยู่ที่ 29.0 ที่ระดับความพยายามสูงสุด เทียบกับ Claude Opus 4.8 ที่ 29.5 — เกือบเสมอกันบนฮาร์เนสของผู้ขายเอง รันบน Claude Code 2.1.207 ตามที่ผู้ขายรายงาน นั่นไม่ใช่การเปรียบเทียบที่เป็นอิสระ และไม่ใช่การเปรียบเทียบที่ปรับความพยายามให้เท่ากันซึ่งดำเนินการโดยบุคคลที่สาม แต่เป็นการที่ Z.ai วัดโมเดลของตนเทียบกับคู่แข่งบนการประเมินของตนเอง และผู้ขายอ้างอิง Artificial Analysis Intelligence Index ที่ 57 ในราคา $0.045 ต่องาน โดยระบุรุ่นแก้ไขเป็น v4.1.1

ตัวเลขนั้นจำเป็นต้องแยกออกจากสิ่งที่ Artificial Analysis เผยแพร่ในวันนี้ เพราะทั้งสองอย่างไม่อาจนำมาวางเคียงกันในฐานะการเปลี่ยนแปลงได้ หน้าของ Artificial Analysis เองสำหรับ GLM-5.3-Flash ซึ่งอ่านเมื่อ 2026-09-28 รายงานค่า Intelligence Index ที่ 41.8 บน Index v4.3.2 ซึ่งบันทึกที่ max effort โดย v4.3.2 รวมการประเมินสิบรายการ ได้แก่ AA-Briefcase v1.1, GDPval-AA v2.1, AutomationBench-AA, Terminal-Bench 4.0, SciCode, Humanity's Last Exam, GDP.pdf, CritPt, AA-Omniscience และ AA-LCR v1.1 — ส่วน v4.1.1 ไม่ได้รวม การปรับปรุงดัชนีสองครั้ง ชุดงานสองชุด ตัวเลขสองตัว ไม่มีตัวใดผิด因为它们ไม่ใช่การวัดเดียวกัน และการอ้างอิงเลข 57 วางคู่กับ 41.8 ราวกับว่าโมเดลขยับไปแล้ว ย่อมเป็นความผิดพลาดไม่ว่าจะในทางใด

สิ่งที่บันทึกจากฝ่ายอิสระยืนยันได้จริงคือกรอบข้อมูลโดยรวมมากกว่าคะแนน: Artificial Analysis บันทึกอย่างอิสระว่ามีพารามิเตอร์ทั้งหมด 320B, เปิดใช้งาน 18B, หน้าต่างบริบท 1,000,000 โทเคน, การอนุญาตแบบ MIT, น้ำหนักเปิด และวันที่เผยแพร่ 2026-08-26 และระบุราคาจากผู้ขายที่ $0.15 ขาเข้า และ $0.50 ขาออก ต่อล้านโทเคน โดยมีราคากรณีแคชฮิตที่ $0.026 ในกรณีที่ผู้ขายเผยแพร่คะแนนแต่ฝ่ายอิสระไม่ได้เผยแพร่ เราจะบอกไว้เช่นนั้น; ในกรณีที่ฝ่ายอิสระยืนยันสเปก นั่นคือข้อเท็จจริงระดับที่แข็งแรงที่สุดในหน้านี้

ตรงนี้ไม่มีการเปรียบเทียบแบบตัวต่อตัวที่จับคู่กันอย่างเหมาะสม และการบอกเช่นนั้นมีประโยชน์กว่าการสร้างมันขึ้นมาเสียอีก ยังไม่มีใครเผยแพร่ผลการรัน GLM-5.3-Flash เทียบกับ Claude Opus 4.8, GPT-6 Sol หรือ Grok 4.7 ที่ระดับความพยายามที่ระบุไว้บนฮาร์เนสเดียวกัน — การเปรียบเทียบของ Z.ai เองนั้นทำบนเบนช์ของตัวเอง ที่ความพยายามสูงสุด เทียบกับค่าดีฟอลต์ของคู่แข่ง จนกว่าสิ่งนั้นจะเปลี่ยนไป การเปรียบเทียบอย่างซื่อตรงระหว่างโมเดลนี้กับสิ่งอื่นใดก็ตามจะอยู่ที่ราคา ขอบเขต (envelope) และพื้นผิวเอนด์พอยต์ ซึ่งเป็นสามสิ่งบนหน้านี้ที่ทุกคนสามารถอ่านได้จากตัวเลขชุดเดียวกัน

สิ่งที่ไม่ได้ถูกบันทึกไว้ กล่าวอย่างตรงไปตรงมา

หน้าอ้างอิงสำหรับโมเดลที่มีพื้นผิวข้อมูลแบบบางจะเกิดประโยชน์ก็ต่อเมื่อมันซื่อสัตย์เกี่ยวกับช่องว่าง และหน้านี้ก็มีหลายช่องว่าง

• ไม่มีจุดตัดความรู้ของผู้ให้บริการ เอกสารของ Z.ai และการ์ดโมเดลของ Hugging Face ไม่ได้ระบุไว้ และบันทึกของ Artificial Analysis ก็ปล่อยฟิลด์นั้นเป็น null การประมาณการจากช่วง stealth เป็นผลงานของชุมชน ไม่ใช่ตัวเลขจากผู้ให้บริการ และหน้านี้ไม่ได้นำตัวเลขใด ๆ มาแสดงซ้ำในลักษณะที่เสมือนเป็นตัวเลขจากผู้ให้บริการ

• ไม่มีเชิงอรรถเกี่ยวกับฮาร์เนสสำหรับชีต benchmark ส่วนใหญ่ การ์ดโมเดลมีเชิงอรรถสำหรับการรัน HLE แบบใช้เครื่องมือ — temperature 1.0, top_p 0.95, ความยาวการสร้างสูงสุด 163,840 โทเคน, การประเมินที่บริบทสูงสุดถึง 300,000 โทเคนพร้อมกลยุทธ์การจัดการบริบท และ GPT-5.6 Luna ที่ความพยายามระดับกลางเป็นโมเดลผู้ตัดสิน — และสำหรับ NL2Repo และ DeepSWE ซึ่งผู้จำหน่ายกล่าวว่าได้รันด้วยฮาร์เนส mini-swe-agent แถวที่เหลือเป็นเพียงเปอร์เซ็นต์เปล่า ๆ โดยไม่มีฮาร์เนสหรือระดับความพยายามกำกับ

• ไม่มีคำอธิบายสำหรับส่วนต่างราคาของอินพุตที่แคชไว้ ตัวเลขสามค่าสำหรับปริมาณเดียวกันบนโมเดลเดียวกัน และไม่มีแหล่งข้อมูลใดระบุว่าทำไมจึงแตกต่างกัน

ไม่มีการวัดประสิทธิภาพจากแหล่งอิสระใด ๆ สำหรับช่วงการให้บริการแบบไม่เปิดเผยตัวตน รายการแบบซ่อนตัวนั้นหายไปแล้ว สิ่งที่มันวัดไว้ก็ไม่อาจวัดซ้ำได้อีก และไม่มีบุคคลที่สามรายใดเผยแพร่ผลการทดสอบกับนามแฝงนั้นในระหว่างที่ยังเปิดให้ใช้งานอยู่

• ไม่มีการเปรียบเทียบกับบุคคลที่สามที่มีความพยายามเท่ากัน ด้วยเหตุผลที่ระบุไว้ข้างต้น

• ไม่มีการยืนยันจากผู้ขายเกี่ยวกับจำนวนชิปในยุคเปิดตัว เอกสารระบุว่ามีตัวเร่งความเร็วภายในประเทศหลายหมื่นตัว; ตัวเลข 100,000 ไม่ปรากฏอยู่ในหน้านั้น

สรุปเลย: สิ่งที่แค็ตตาล็อกของเรานำเสนอ ซึ่งตรวจสอบยืนยันแล้ววันนี้

A single-column reference scoreboard titled 'GLM-5.3-Flash, the model behind Ox Alpha', with six rows reading 'Context: 1,000,000 tokens', 'Max output: 128K tokens', 'Input / output: text, image, video in / text out', 'Parameters: 320B total, 18B active, MIT licence', 'Vendor list price: $0.15 in / $0.50 out per 1M, $0.03 cached', and 'Served on OrcaRouter: $0.075 in / $0.25 out per 1M'. A footer line reads 'Z.ai-reported envelope and list price; OrcaRouter card read 2026-09-28; Artificial Analysis independently confirms 320B/18B, 1M context and MIT.' The OrcaRouter logo is composited in the bottom-right corner.

โมเดลที่อยู่เบื้องหลัง Ox Alpha เปิดให้ใช้งานจริงในแคตตาล็อกของเราภายใต้ชื่อของมันเอง โดยตรวจสอบเมื่อวันนี้แทนที่จะสันนิษฐานเอา การอ่าน OrcaRouter model API สำหรับ z-ai/glm-5.3-flash เมื่อ 2026-09-28 ส่งคืนการ์ดมาแบบครบถ้วน: หน้าต่างบริบท 1,000,000 โทเคน, เอาต์พุตสูงสุด 128,000, อินพุตข้อความ รูปภาพ และวิดีโอพร้อมเอาต์พุตข้อความ, ป้ายความสามารถ vision, tools, JSON และ reasoning, วันที่เปิดตัว 2026-08-26, ไม่ถูกเลิกใช้งานและไม่ถูกถอดออกจากรายการ, ราคา $0.075 ต่อหนึ่งล้านโทเคนอินพุต, $0.25 ต่อหนึ่งล้านโทเคนเอาต์พุต และ $0.0173 ต่อหนึ่งล้านโทเคนอินพุตที่แคชไว้, ผ่านปลายทางเดียว POST /v1/chat/completions

การวัดผลในเพลย์กราวด์ของเราเองเป็นเวลา 7 วันบนการ์ดนั้น สำหรับช่วงเวลาเดียวกัน อ่านค่าได้ 61.8 โทเคนเอาต์พุตต่อวินาที ค่า p50 ของเวลาถึงโทเคนแรกอยู่ที่ 7.39 วินาที และอัตราข้อผิดพลาด 1.47% นี่เป็นตัวเลขจากฝ่ายเราเองเกี่ยวกับการให้บริการของเรา ไม่ใช่ตัวเลขจากผู้ขาย และไม่ใช่การทดสอบประสิทธิภาพอิสระ และด้วยเหตุนี้จึงเป็นตัวเลขความเร็วชุดเดียวในหน้านี้

ชื่อเรียกแทน (alias) นี้ไม่ได้อยู่บนเส้นทางนั้น หากคุณมาที่นี่จากการค้นหา Ox Alpha โมเดลที่ต้องเรียกใช้คือ z-ai/glm-5.3-flashและรูปแบบคำขอคือแบบที่อธิบายไว้ข้างต้น มันใช้คีย์เดียวกันกับทุกอย่างในแคตตาล็อก — API เดียวครอบคลุม 200+ โมเดลราคาของผู้ให้บริการส่งผ่านตรงโดยไม่มีการบวกเพิ่ม และระบบสลับไปใช้ตัวอื่นอัตโนมัติเมื่อผู้ให้บริการหยุดชะงักดังนั้นโมเดลที่คุณกำลังลองทดสอบอยู่จึงไม่จำเป็นต้องเป็นโมเดลที่เส้นทางการผลิตของคุณต้องพึ่งพา

A screenshot of the OrcaRouter model page for Z.ai GLM-5.3-Flash (z-ai/glm-5.3-flash), showing the model name and provider, a 1M-token context window with 128K maximum output, text, image and video input with text output, a stat strip reading $0.075 input and $0.25 output per million tokens, the capability chips Vision, Tools, JSON and Reasoning, a release date of 2026-08-26 and a supported-endpoint line reading POST /v1/chat/completions, with a code sample against the OpenAI-compatible base URL https://api.orcarouter.ai/v1.

ขอชี้แจงหนึ่งเรื่องว่าหน้านี้คืออะไร เพราะผู้อ่านที่มาถึงจากชื่อของโมเดลเองสมควรได้รับคำอธิบายนี้ นี่คือหน้าอ้างอิงสำหรับโมเดลที่อยู่ในแคตตาล็อกแล้ว ไม่ใช่รายงานการเปิดตัว: GLM-5.3-Flash มาจากวันที่ 26 สิงหาคม 2026 และการที่มันอยู่ตรงนี้ rests on the fact that ชื่อ Ox Alpha ยังคงถูกค้นหาเรื่อย ๆ โดยไม่มีหน้าเฉพาะให้เข้าถึง ไม่ใช่เพราะความใหม่ของการเปิดตัว วันที่ด้านบนใช้เพื่อระบุวันที่ของโมเดล ไม่ได้ใช้เป็นข่าว สิ่งที่จะทำให้หน้านี้เปลี่ยนไปคือหนึ่งในสี่สิ่งนี้ — การรันเบนช์มาร์กโดยอิสระที่ระดับความพยายามที่ระบุไว้, วันตัดความรู้ที่ผู้ขายระบุ, การเปลี่ยนแปลงของอัตราการให้บริการ, หรือการตัดสินใจของ Z.ai ที่จะระบุว่าจำนวนชิปในช่วงเปิดตัวจริง ๆ แล้วเป็นเท่าใด จนกว่าหนึ่งในนั้นจะเกิดขึ้น ข้อกำหนดข้างต้นคือทั้งหมดเท่าที่ผู้ขายจัดทำเอกสารไว้ และช่องว่างที่ระบุไว้ในหัวข้อก่อนหน้านี้ก็เป็นส่วนหนึ่งของคำตอบพอ ๆ กับตัวเลข

การเปรียบเทียบในบทความนี้2

ตรวจพบจากบทความนี้ · เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน

© 2026 OrcaRouter

สำหรับผู้ให้บริการ

ให้บริการแพลตฟอร์มการอนุมานอยู่หรือไม่ นำโมเดลของคุณขึ้น OrcaRouter

providers@orcarouter.ai

เข้าร่วมคอมมูนิตี้ของเรา

Discordsupport@orcarouter.aiXGitHubYouTube