การ์ดบทความหลักที่แสดงข้อความ 'GLM 5.5 หรือ GLM 5.3-Vision?' พร้อมคำบรรยายว่า 'โมเดลนิรนามที่ตรงกับลายเซ็นของ Z.ai เพิ่งปรากฏขึ้น' และป้าย 'LEAK — ยังไม่ยืนยัน' บนพื้นไล่เฉดสีขาว-น้ำเงินนุ่มนวล ลวดลายโครงข่ายประสาทเทียมแบบละเอียดอ่อน และองค์ประกอบเครื่องหมายคำถาม
Guides & Insights

GLM 5.5 หรือ GLM 5.3-Vision? โมเดลนิรนามที่ตรงกับฟิงเกอร์พรินต์ของ Z.ai เพิ่งปรากฏตัวขึ้น

ผู้เขียน

Magnus Corvin

วันที่เผยแพร่

โมเดลล่าสุด · 20ดูโมเดลทั้งหมด →
เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
กลับไปยังโพสต์ทั้งหมด

โมเดลนิรนามที่โปรไฟล์การให้บริการของมัน — ความเร็ว, time-to-first-token, อัตราการชนแคช — ตรงกับสแตกของ G​LM ของ Z.ai กำลังเริ่มดึงดูดความสนใจจากนักวิเคราะห์ความจุ และการคาดเดาเบื้องต้นคือมันอาจถูกตั้งชื่อว่า GLM 5.3-Vision หรือ GLM 5.5 เมื่อวันที่ 20 สิงหาคม teortaxesTex นักวิเคราะห์ด้านการคำนวณและความจุ โพสต์ว่าโมเดลนิรนามที่เขาติดตามอยู่นั้น "อย่างน้อยก็ไม่ใช่ Dee​pSeek แน่นอน" "ยังไม่มีอะไรตัดความเป็นไปได้ของ G​LM ออกไป" และ "ความเร็ว, ttft, อัตราการชนแคชก็ตรงกับ G​LM ด้วย" การประเมินของเขา: คาดว่ามันจะถูกเรียกว่า GLM 5.3-Vision หรือ 5.5 โดยได้คะแนนประมาณ 61 บน Artificial Analysis Intelligence Index — สูงกว่าที่ GLM-5.3 ซึ่งวางจำหน่ายแล้วตั้งอยู่ 1 จุด ไม่มีสิ่งใดได้รับการยืนยันในตอนนี้ ยังไม่มี model card, ไม่มีการประกาศจาก Z.ai, และไม่มี API และหน้านี้ถือว่าการพบเห็นนี้เป็นสิ่งที่มันเป็น: สัญญาณหลุดช่วงต้นที่ยังไม่มีการยืนยันซ้ำ ซึ่งน่าติดตามเป็นพิเศษเพราะ GLM-5.5 เป็นเรือธงที่คาดหวังของ Z.ai มาตลอดทั้งเดือนและยังไม่ปรากฏ ห้าวันหลังโพสต์นั้น จุดข้อมูลที่สองซึ่งครั้งนี้ตรวจสอบได้อย่างเต็มที่ก็มาถึง: เมื่อวันที่ 25 สิงหาคม vLLM — รันไทม์สำหรับการอนุมานที่อยู่เบื้องหลังการให้บริการโมเดลขนาดใหญ่ส่วนใหญ่ — ได้เปิด pull request แบบ Do-Not-Merge ที่เปิดใช้งานการรองรับเคอร์เนลแบบ masked-MHA สำหรับมิติหัวของ G​LM-5 มันไม่ได้ระบุตัวแปรใดๆ และไม่ได้พิสูจน์การเปิดตัว มันเป็นงานพื้นฐานของสแตกการให้บริการ ซึ่งเป็นกิจกรรมเบื้องหลังแบบที่โมเดลใหม่ทิ้งไว้

สิ่งที่สัญญาณบอกจริงๆ

แหล่งข้อมูลคือโพสต์ X โพสต์เดียวจาก teortaxesTex ลงวันที่ 20 สิงหาคม — บัญชีเดียวกับที่สัญญาณเวลา "ประมาณหนึ่งสัปดาห์" เกี่ยวกับการเปิดตัว GLM-5.3 ตรงวันเป๊ะเมื่อเดือนสิงหาคมที่ผ่านมา กรอบการนำเสนอชัดเจนเกี่ยวกับระดับหลักฐาน: "หลักฐานที่แข็งแกร่ง (ยังไม่ได้ทำซ้ำ)" นักวิเคราะห์ตัด Dee​pSeek ออก ไม่พบสิ่งใดที่ขัดแย้งกับ G​LM และอ้างอิงการวัดระดับเซิร์ฟวิ่งสามอย่าง — ปริมาณงาน (throughput) เวลาจนถึงโทเค็นแรก (time-to-first-token) และอัตราการเข้าถึงแคช (cache hit rate) — ว่าตรงกับสแตกของ Z.ai จากนั้นก็คือชื่อตัวเลือกสองชื่อ และคะแนนที่คาดการณ์: "ตอนนี้ฉันคาดว่ามันจะถูกเรียกว่า GLM 5.3-Vision หรือ 5.5 และได้คะแนนประมาณ 61 ใน AA"

พิจารณาแต่ละส่วนแยกกัน การอ้างตัวตน (ไม่ใช่ Dee​pSeek แต่ตรงกับ G​LM) เป็นการอนุมานจากลายนิ้วมือของวิธีการให้บริการโมเดล ไม่ใช่ model card คะแนนเป็นความคาดหวัง ไม่ใช่การวัดผล ชื่อที่กล่าวถึงเป็นเพียงการเดา สิ่งที่ทำให้สัญญาณนี้มีค่ามากกว่าเสียงรบกวนก็คือ มันสอดคล้องในทิศทางเดียวกับทุกอย่างที่เรารู้เกี่ยวกับแผนงานของ Z.ai ในเดือนนี้: GLM-5.3 เปิดตัวเฉพาะข้อความ คำขอที่ดังที่สุดเพียงหนึ่งเดียวของชุมชนคือระบบวิทัศน์ (vision) และ GLM-5.5 ได้รับรายงานจากหลายสำนัก (ผ่าน JPMorgan, Reuters, CGTN และบันทึกของ Goldman เมื่อวันที่ 18 สิงหาคม) ว่าจะมาถึง "ภายในเดือนสิงหาคม" — นี่คือช่วงสุดท้ายของเดือนแล้ว

เหตุใดลายนิ้วมือการให้บริการจึงสำคัญ

เวลาในการสร้างโทเคนแรก (time-to-first-token) และอัตรา cache hit เป็นลายเซ็นระดับโครงสร้างพื้นฐาน ค่าเหล่านี้ถูกกำหนดโดยวิธีที่ผู้ให้บริการสร้างสแตกการอนุมาน (inference stack) ของตน — ตัวจัดตาราง (scheduler), การจัดวางแคช (cache layout), นโยบายการแบตช์ (batching policy) — ไม่ใช่โดยชื่อโมเดลที่พรอมพต์เรียกใช้ เมื่อนักวิเคราะห์กล่าวว่า TTFT และอัตรา cache hit ของโมเดลนิรนามตรงกับ G​LM นั่นหมายความว่าพวกเขากำลังบอกว่าสแตกการให้บริการ (serving stack) ที่อยู่เบื้องหลังทำงานเหมือนกับของ Z.ai ซึ่งเป็นสิ่งที่ใกล้เคียงกับลายนิ้วมือมากที่สุดเท่าที่จะได้มาโดยไม่ต้องเข้าถึงน้ำหนัก (weights) หรือโมเดลการ์ด (model card) นี่ไม่ใช่ข้อพิสูจน์ ผู้ขายรายอื่นอาจเลียนแบบสแตกเดียวกันนี้ หรือ Z.ai อาจให้บริการโมเดลสำหรับพันธมิตร แต่มันเป็นข้อกล่าวอ้างที่เฉพาะเจาะจงและตรวจสอบได้ และคำเตือนที่ว่า "ยังไม่ได้ทำซ้ำ" บอกให้รู้ว่านักวิเคราะห์ไม่ได้นำเสนอเรื่องนี้ว่าเป็นที่ยุติแล้ว

การตัด Dee​pSeek ออกไปก็สำคัญเช่นกัน Dee​pSeek V4 Pro เปิดตัว GA เมื่อวันที่ 13 สิงหาคม และบิลด์ Flash ของมันก็เป็นการรีลีสโอเพนเวตสัญชาติจีนที่ปล่อยออกมาด้วยความเร็วสูงอีกตัวในเดือนนี้ โมเดลนิรนามที่ตัด Dee​pSeek ออกแต่ชี้ไปที่ G​LM ทำให้ขอบเขตแคบลงเหลือเพียงไปป์ไลน์ของ Z.ai — และไปป์ไลน์ของ Z.ai ก็มีตัวเลือกที่น่าจะเป็นไปได้สองตัว ซึ่งก็คือทางแยกที่สัญญาณระบุชื่อไว้พอดี

สัญญาณที่สอง: serving stack กำลังถูกสร้างขึ้นเพื่อรองรับ attention ของ GLM-5

ในวันที่ 25 สิงหาคม จุดข้อมูลที่สองก็มาถึง — จุดนี้ตรวจสอบได้อย่างสมบูรณ์ vLLM ซึ่งเป็นรันไทม์การอนุมานที่อยู่เบื้องหลังระบบให้บริการโมเดลขนาดใหญ่ส่วนใหญ่ ได้รับ Pull Request #53785 ชื่อว่า "[Do Not Merge][Attention] Enable masked MHA for GLM-5 head dimensions." เมื่อตรวจสอบกับ repository แล้ว มันเปิดใช้งานเส้นทาง prefill ของ masked-MHA สำหรับเรขาคณิต attention ของ G​LM-5: 64 heads, KV rank 512, QK head dimension 192+64, และ V head dimension 256 — เลย์เอาต์ QK/V แบบ 256/256 ตามคำอธิบายใน PR มันต้องอาศัยการเปลี่ยนแปลงใน FlashAttention เพื่อรองรับมาสก์แบบ head dimension 256 โดยชั่วคราวตรึง FlashAttention ไว้กับคอมมิตจาก fork (ซึ่งเป็นจุดประสงค์ของเครื่องหมาย Do Not Merge) และเพิ่มเกณฑ์การกำหนดเส้นทางที่ผ่านการวัดประสิทธิภาพสำหรับเส้นทางใหม่: ขีดจำกัด pure-prefill ของ FlashMLA ที่ 8K / 20K / 48K / 112K โทเคนที่ TP 1/2/4/8 และขีดจำกัด 64K โดยประมาณสำหรับ FlashInfer ที่ TP8 ผู้เขียนตั้งข้อสังเกตว่าไม่มี PR เปิดอื่นใดที่ครอบคลุมการสนับสนุน masked-MHA ของ G​LM-5

อ่านตามที่มันเป็น: งานวางรากฐานของ serving-stack ไม่ใช่การประกาศ PR ไม่ได้เอ่ยชื่อ GLM 5.5 หรือ GLM 5.3-Vision — มันระบุว่า "GLM-5" — และการเปิดเส้นทาง prefill แบบ masked-MHA สำหรับมิติ head ของ G​LM-5 เป็นงานโครงสร้างพื้นฐานบนตระกูลที่ระบบนิเวศ vLLM รันผ่านเส้นทาง sparse-MLA อยู่แล้ว (สายเลือดของ GLM-5.3 เองก็ถูกเสิร์ฟที่นั่นในปัจจุบัน) มันไม่ได้โดดเดี่ยวด้วย: PR ในเครือเดียวกันเดือนนี้ครอบคลุมการตรวจมิติ MLA ของ FlashInfer สำหรับ GLM-5, fallback แบบ Triton sparse-MLA สำหรับโมเดลระดับ GLM-5 และการรองรับมิติที่รายงานของ FlashAttention สองรายละเอียดทำให้มันยังอยู่ในเรดาร์ของ leak tracker ประการแรก โครงสร้างที่มันกำหนดเป้าหมาย — 64 heads, KV rank 512, 256/256 QK/V — แตกต่างจากของ Dee​pSeek ที่เป็น 192/128 ซึ่งก็คือการแยกแบบ "ไม่ใช่ Dee​pSeek ตรงกับ G​LM" แบบเดียวกับที่ลายนิ้วมือของโมเดลนิรนามวาดไว้ บัดนี้ปรากฏชัดในระดับ attention-kernel ประการที่สอง จังหวะเวลา: PR เปิดเมื่อวันที่ 25 สิงหาคม ในหน้าต่างเดือนสิงหาคมเดียวกันกับที่ GLM-5.5 ถูกคาดหวังมาตลอดทั้งเดือน ทั้งหมดนั้นไม่ได้พิสูจน์ว่าโมเดลนิรนามเป็น G​LM รุ่นถัดไป — นี่อาจเป็นงานวิศวกรรมบนโมเดลที่เปิดตัวไปแล้วก็ได้ — แต่มันเป็นกิจกรรมเบื้องหลังแบบที่ระบบนิเวศ serving ทำก่อนมีโมเดลใหม่ และตรวจสอบยืนยันได้ในแบบที่โพสต์บน X ทำไม่ได้

สองชื่อ หนึ่งฟอร์ก: GLM 5.3-Vision vs GLM 5.5

ตัวตนที่เป็นตัวเลือกสองตัวนี้เป็นผลิตภัณฑ์ที่แตกต่างกันอย่างแท้จริง และการรั่วไหลไม่ได้ไขข้อสงสัยว่าตัวไหนอยู่บนบอร์ด

• GLM 5.3-Vision จะเป็นเวอร์ชันที่รองรับภาพของโมเดลที่เปิดตัวเมื่อวันที่ 14 สิงหาคม GLM-5.3 รองรับเฉพาะข้อความเท่านั้น — Artificial Analysis ระบุว่าเป็นข้อความเข้า ข้อความออก ไม่รองรับภาพ — และช่องว่างนี้คือข้อร้องเรียนที่ดังที่สุดจากชุมชน เมื่อ Tang Jie จาก Z.ai จัดแคมเปญรับฟังความคิดเห็นทั่วโลก ความคิดเห็นที่ได้กลับมาเป็นเอกฉันท์ว่าต้องการให้รองรับภาพ และ Z.ai ก็มีส่วนประกอบพื้นฐานอยู่แล้ว (โมเดลมัลติโมดัล GLM-5V-Turbo และตัวเข้ารหัส CogVLM) ที่ยังไม่ได้รวมเข้ากับไลน์เรือธง เวอร์ชัน 5.3-Vision จะเป็นวิธีที่เร็วที่สุดในการปิดช่องว่างนั้น

GLM 5.5 คือเรือธงโดยแท้จริง สเปกที่มีรายงานแต่ยังไม่ได้รับการยืนยันบ่งชี้ว่ามีพารามิเตอร์พื้นฐานเกินหนึ่งล้านล้าน (เพิ่มขึ้นจาก 743B ของ GLM-5.3) บริบท 1M โทเค็นที่ถูกส่งต่อมาจากเวอร์ชันก่อน น้ำหนักแบบเปิด และการมุ่งเน้นด้าน agentic/coding ที่มากขึ้น รายงานจากนักวิเคราะห์ทุกฉบับในเดือนนี้มองว่า 5.5 คือรุ่นที่ยิ่งใหญ่ — ยานพาหนะที่ Tang Jie ผู้ร่วมก่อตั้ง Z.ai ได้บอกเป็นนัยว่าจะช่วยปิดช่องว่างกับโมเดลปิดระดับ Fable คาดว่าจะเปิดตัวภายในเดือนสิงหาคม และยังไม่ได้วางจำหน่าย ณ เวลาที่เขียนข้อความนี้

ลายนิ้วมือเดียวกันไม่สามารถบอกคุณได้ว่ามันคือแบบใดจากสองแบบนี้ — โมเดล 5.3 ที่ปรับแต่งสำหรับวิทัศน์และเรือธงรุ่นใหม่ต่างก็สามารถขับเคลื่อนบนสแตกการให้บริการชุดเดียวกันได้ ความคลุมเครือนั้นคือสถานะที่แท้จริงของสัญญาณ และชื่อสองชื่อในโพสต์ของนักวิเคราะห์สะท้อนมันออกมาแทนที่จะไขปริศนา

<img src="2.png" alt="กระดานเปรียบเทียบสองคอลัมน์ชื่อ 'GLM 5.5 เทียบกับ GLM-5.3 — กระดานคะแนน'. คอลัมน์ซ้าย GLM 5.5 (ข้อมูลหลุด): 'AA Index ~61 (คาดการณ์ ยังไม่ยืนยัน)', 'สถานะ: ยังไม่เปิดตัว', 'ขนาด >1T พารามิเตอร์ (ที่ลือกัน)', 'การมองเห็น: คาดว่าจะมี', 'บริบท: 1M (คาดการณ์)', 'ราคา: ยังไม่ระบุ'. คอลัมน์ขวา GLM-5.3 (เปิดตัวแล้ว): 'AA Index 60', 'สถานะ: API ใช้งานจริง 19 ส.ค.', 'ขนาด 743B MoE / 40B แอ็กทีฟ', 'การมองเห็น: ข้อความเท่านั้น', 'บริบท: 1M', 'ราคา: $1.40 / $4.40'. ด้านล่างระบุว่า 'ตัวเลขของ GLM 5.5 เป็นการคาดการณ์ที่ยังไม่ได้รับการยืนยัน; GLM-5.3 อ้างอิงตาม Artificial Analysis.'" />

A two-column comparison scoreboard titled 'GLM 5.5 vs GLM-5.3 — the scoreboard'. Left column GLM 5.5 (leaked): 'AA Index: ~61 (projected)', 'Status: unreleased', 'Size: >1T params (rumored)', 'Vision: expected', 'Context: 1M (expected)', 'Price: TBD'. Right column GLM-5.3 (shipped): 'AA Index: 60', 'Status: API live Aug 19', 'Size: 743B MoE / 40B active', 'Vision: text-only', 'Context: 1M', 'Price: $1.40 / $4.40'. Footer reads 'GLM 5.5 figures are unverified projections; GLM-5.3 per Artificial Analysis.'

คะแนน ~61 ใน AA Intelligence Index จะหมายถึงอะไร

คะแนนที่คาดการณ์ไว้คือส่วนที่เฉียบคมที่สุดของการรั่วไหล Artificial Analysis Intelligence Index (v4.1.1) ปัจจุบันให้ GLM-5.3 อยู่ที่ 60 — เสมอกับ Kimi K3 ในตำแหน่งคะแนนสูงสุดของโมเดลโอเพนเวต และนำ GLM-5.2 ที่ได้ 53 อยู่ 7 คะแนน สูงขึ้นไปอีกหนึ่งคะแนนที่ 61 คืออาณาเขตของ GPT-5.6 Sol โดย Claude Fable 5 อยู่ที่ 62 และ Claude Opus 5 อยู่ที่ 63 พูดง่ายๆ คือ โมเดลตระกูล G​LM ที่ทำคะแนนได้ 61 จะเป็นคะแนนโอเพนเวตสูงสุดเพียงหนึ่งเดียวบนดัชนีนี้ โดดเด่นเหนือ Kimi K3 และ GLM-5.3 และแทบจะอยู่เส้นแนวหน้าของโมเดลปิด

ควรเน้นย้ำว่าค่า 61 ไม่ใช่อะไร มันคือความคาดหวังของ teortaxesTex ว่าการประเมินอิสระจะให้ผลลัพธ์อย่างไร ไม่ใช่คะแนน Artificial Analysis ที่เผยแพร่ และไม่ใช่ตัวเลขจากผู้จำหน่าย การคาดการณ์อาจผิดพลาดได้ทั้งสองทิศทาง — โมเดลเวอร์ชันภาพอาจแลกคะแนนไปหนึ่งหรือสองคะแนนในดัชนีที่เน้นข้อความ และโมเดลเรือธงขนาด >1T อาจได้คะแนนสูงหรือต่ำกว่าขึ้นอยู่กับการปรับแต่งหลังการฝึกฝน คุณค่าของตัวเลขคือข้ออ้างที่มันสื่อ: ไม่ว่าโมเดลนิรนามนี้จะกลายเป็นใคร มันถูกคาดหวังให้เอาชนะผู้นำ open-weights ในปัจจุบัน มากกว่าแค่ทำเท่ากัน

A screenshot of the Artificial Analysis page for GLM-5.3 (max) showing an Intelligence Index of 60 (well above the median of 35), $1.40 per 1M input tokens and $4.40 per 1M output tokens, text input and text output, a 1M-token context window, and summary text describing the model as leading in intelligence and reasonably priced.

สิ่งที่ได้รับการยืนยันแล้ว และสิ่งที่ยังไม่ได้รับการยืนยัน

รักษาบัญชีให้สะอาด เพราะชิ้นส่วนที่รั่วนั้นจะอยู่หรือตายก็ขึ้นอยู่กับสิ่งนั้น

• ยืนยันแล้ว: GLM-5.3 มีจริง เปิดตัวเมื่อวันที่ 14 สิงหาคม API ใช้งานได้จริงวันที่ 18/19 สิงหาคม ได้คะแนน 60 ในดัชนีความฉลาด AA (วัดโดยอิสระโดย Artificial Analysis) ราคา $1.40 / $4.40 ต่อ 1 ล้านโทเคน รองรับเฉพาะข้อความนำเข้า และยืนยันการเปิดเผยน้ำหนัก (open weights) สำหรับวันศุกร์ที่ 28 สิงหาคม ข้อเท็จจริงเหล่านี้ไม่ได้ขึ้นอยู่กับการรั่วไหล

• ยืนยันแล้ว: GLM-5.5 ยังคงไม่เปิดตัว ณ เวลาที่เขียนนี้ ยังไม่มี model card ไม่มีราคา และไม่มีความพร้อมใช้งาน; ช่วงเดือนสิงหาคมและตัวเลขพารามิเตอร์ >1T เป็นเพียงการรายงานจากนักวิเคราะห์ ไม่ใช่คำมั่นสัญญาจาก Z.ai

• ยังไม่ได้รับการยืนยัน: ว่าโมเดลนิรนามมีอยู่ในฐานะผลิตภัณฑ์แยกต่างหาก ว่าเป็น G​LM ว่าชื่อของมันจะเป็น GLM 5.3-Vision หรือ 5.5 และว่ามันได้คะแนน 61 ข้ออ้างทั้งสี่นี้ตั้งอยู่บนโพสต์เดียวของนักวิเคราะห์หนึ่งคนซึ่งยังไม่มีการทำซ้ำ

• ยังไม่ได้รับการยืนยันเช่นกันว่าแบบจำลองนิรนามนี้จะมีความแตกต่างจาก GLM-5.3 เองหรือไม่ จุดสิ้นสุด GLM-5.3 ที่ใช้งานจริงภายใต้นามแฝงที่ไม่มีป้ายกำกับจะสร้างลายนิ้วมือการให้บริการที่เหมือนกัน จนกว่าชื่อ การ์ดแบบจำลอง หรือการเผยแพร่น้ำหนักจะมาไขข้อสงสัย การตีความว่าเป็น "แบบจำลองใหม่" จึงเป็นเพียงความเชื่อก่อนหน้าที่แข็งแกร่ง แต่ไม่ใช่ข้อเท็จจริง

สิ่งที่ควรดูต่อไป

• วันศุกร์ที่ 28 สิงหาคม — น้ำหนักของ GLM-5.3 หากโมเดลนิรนามนั้นแท้จริงแล้วเป็น 5.3 ที่เปลี่ยนชื่อหรือเป็น 5.3-Vision การปล่อยน้ำหนักและการ์ดโมเดลจะช่วยพิสูจน์ได้อย่างรวดเร็ว

• การพบเห็นยืนยันครั้งที่สอง {{1}}ลายนิ้วมือของนักวิเคราะห์คนหนึ่งเป็นเพียงสมมติฐาน การอ่านรายการนิรนามเดียวกันอย่างอิสระเป็นครั้งที่สอง หรือรายการใน Artificial Analysis ที่ระบุชื่อของมัน จะยกระดับให้เป็นหลักฐาน{{/1}}

• คำแถลงใดๆ จาก Z.ai มีรายงานว่า GLM-5.5 จะเปิดตัวในช่วงเดือนสิงหาคม และเดือนก็ใกล้จะสิ้นสุดลงแล้ว การตั้งชื่ออย่างเป็นทางการ หน้าราคา หรือรายการเปลี่ยนแปลงใน API คือเหตุการณ์ที่จะเปลี่ยนข้อมูลหลุดนี้ให้กลายเป็นเรื่องราวการเปิดตัว

• ไม่ว่าคะแนน AA จะออกมาที่ 61 หรือไม่ หากโมเดลนิรนามนั้นมีจริงและอยู่ในตระกูล GLM คะแนนดัชนีอิสระที่ใกล้ 61 จะเป็นตัวเลขโอเพนเวตตัวแรกที่ผ่าน 60

• ไม่ว่างาน attention ของ vLLM จะได้ชื่อโมเดลติดมาหรือไม่ PR #53785 กำหนดขนาด head ของ "GLM-5" โดยไม่เอ่ยถึง 5.3-Vision หรือ 5.5; การ merge, รายการโมเดลที่รองรับ, หรือ model card ที่จับคู่เรขาคณิตนั้นกับชื่อเฉพาะ จะเป็นสัญญาณที่หนักแน่นที่สุดเท่าที่เคยมีมา

วิธีจัดการกับการรั่วไหลแบบนี้

การรั่วไหลเป็นเหตุผลให้เตรียมพร้อม ไม่ใช่เหตุผลให้เปลี่ยนแพลตฟอร์ม หากรุ่นตระกูล G​LM ตัวถัดไปรั้งตำแหน่งบนหรือใกล้กับจุดสูงสุดของลีดเดอร์บอร์ดโอเพนเวตส์ คำถามเชิงปฏิบัติคือจะส่งทราฟฟิกจริงไปยังโมเดลนั้นหรือไม่ — และโมเดลที่ยังไม่ผ่านการพิสูจน์ซึ่งมีเพียงคำกล่าวอ้างจากผู้ผลิตและการคาดการณ์ของนักวิเคราะห์รายเดียว คือกรณีที่คุณต้องการตาข่ายนิรภัยมากกว่าการเดิมพัน GLM-5.3 ที่เปิดตัวเมื่อสัปดาห์ที่แล้วใช้งานจริงบน OrcaRouter แล้ว — หน้าโมเดลแสดงราคาที่ $1.26 / $3.96 ต่อ 1M โทเคน ซึ่งเป็นส่วนลดเปิดตัว 10% จากราคารายการของผู้ผลิตที่ $1.40 / $4.40 โดยส่งผ่านโดยไม่มีมาร์กอัป — และการตั้งค่าการจัดเส้นทางคือสิ่งที่รุ่น 5.5 หรือ 5.3-Vision จะได้รับสืบทอดในวันที่เปิดตัว ส่งทราฟฟิกส่วนหนึ่งไปยังโมเดลใหม่ผ่านเราเตอร์ พร้อมการเฟลโอเวอร์อัตโนมัติไปยังโมเดลที่พิสูจน์แล้ว — GLM-5.3, DeepSeek V4 Pro, GPT-5.6 Sol — และคุณจะได้สัญญาณคุณภาพจากเวิร์กโหลดของคุณเอง แทนที่จะเป็นสไลด์เด็ค หากการคาดการณ์จากข่าวรั่วนั้นถูกต้อง คุณจะรู้ก่อนใคร; หากผิด การเฟลโอเวอร์จะดูดซับผลกระทบไว้ และจะไม่มีอะไรที่ส่งออกไปแล้วเสียหาย ใช้คีย์เดียวกัน ไม่ต้องมีสัญญาฉบับที่สอง และไม่ต้องเลือกระหว่างชื่อตัวเลือกสองชื่อจนกว่า Z.ai จะเลือก

G​LM ตัวถัดไปกำลังจะมา — คำถามเดียวที่ยังเปิดอยู่คือมันจะใช้ชื่อไหน GLM 5.3-Vision จะทำให้ Z.ai ปิดช่องโหว่ที่ถูกบ่นมากที่สุดในโมเดลที่เพิ่งส่งออกมา; GLM 5.5 จะเป็นเรือธงพารามิเตอร์ล้านล้านที่ทั้งเดือนชี้เป้าไว้ รายการนิรนามที่ teortaxesTex ระบุลายนิ้วมือเมื่อวันที่ 20 สิงหาคม เป็นวัตถุชิ้นแรกที่ดูเหมือนจะเป็นหนึ่งในสองชื่อนั้น และคะแนนที่คาดการณ์ไว้ที่ 61 บน AA Intelligence Index จะทำให้มันนำหน้าโมเดล open-weights ทุกตัวที่อยู่อันดับในปัจจุบัน ห้าวันหลังจากการระบุลายนิ้วมือ สแตกการให้บริการก็ขยับตาม: งาน attention ของ G​LM-5 ใน vLLM คือประเภทของงานพื้นฐานที่โมเดลใหม่ทิ้งไว้ แม้ว่ามันจะไม่ระบุเวอร์ชันก็ตาม ยังไม่มีอะไรได้รับการยืนยัน และหน้านี้จะอัปเดตทันทีที่ชื่อ การ์ด หรือค่าน้ำหนักเฉลยออกมา จนกว่าจะถึงตอนนั้น การเคลื่อนไหวที่มีความเสี่ยงต่ำคือเตรียม routing ให้พร้อม — อย่าเดิมพันทั้งสแตกกับลายนิ้วมือเพียงอย่างเดียว

The OrcaRouter model page for z-ai/glm-5.3, showing the model id, capability chips (Tools, JSON, Reasoning), a 1,000,000-token context window, a 128,000-token max output, text input and text output, and pass-through pricing of $1.26 per 1M input tokens and $3.96 per 1M output tokens.

การเปรียบเทียบในบทความนี้1

ตรวจพบจากบทความนี้ · เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน

© 2026 OrcaRouter

สำหรับผู้ให้บริการ

ให้บริการแพลตฟอร์มการอนุมานอยู่หรือไม่ นำโมเดลของคุณขึ้น OrcaRouter

providers@orcarouter.ai

เข้าร่วมคอมมูนิตี้ของเรา

Discordsupport@orcarouter.aiXGitHubYouTube