
GLM-5.3-Flash เมื่อผ่านไปห้าสัปดาห์: คะแนน 42 จากการทดสอบอิสระ, การรัน Exploit ระดับ Mythos และ GLM Agent ที่สร้างสแต็กการให้บริการของตัวเองขึ้นมาใหม่
- Orcaใหม่Orca: OrcaCyber Zero 1.52026-10-10$3.00 / $7.50 ต่อ 1 ล้านโทเค็น · 87 tok/s
- openaiใหม่OpenAI: GPT-6.1 Sol2026-09-2952ความฉลาด
- anthropicใหม่Anthropic: Claude Sonnet 5.52026-09-2856ความฉลาด
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 ต่อ 1 ล้านโทเค็น · 115 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238ความฉลาด
- OpenAIOpenAI: GPT-6 Sol2026-09-2248ความฉลาด
- AnthropicAnthropic: Claude Opus 5.52026-09-2258ความฉลาด
- xAIGrok 4.72026-09-2146ความฉลาด
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 ต่อ 1 ล้านโทเค็น · 47 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 ต่อ 1 ล้านโทเค็น · 777 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040ความฉลาด
- OpenAIOpenAI: GPT-6 Astra2026-09-0453ความฉลาด77การเขียนโค้ด
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241ความฉลาด76การเขียนโค้ด
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245ความฉลาด76การเขียนโค้ด
- AnthropicAnthropic: Claude Fable 5.12026-09-0153ความฉลาด82การเขียนโค้ด
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 ต่อ 1 ล้านโทเค็น · 61 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น · 452 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642ความฉลาด72การเขียนโค้ด
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 ต่อ 1 ล้านโทเค็น · 231 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845ความฉลาด75การเขียนโค้ด
GLM-5.3-Flash ให้บริการทราฟฟิกโปรดักชันมาเป็นเวลาห้าสัปดาห์ และเมื่อวันที่ 17 กันยายน 2026 Zhipu AI ได้กล่าวบางอย่างเกี่ยวกับเรื่องนี้: บริษัทเปิดเผยว่าทุกคำขอโปรดักชันสำหรับ GLM-5.3-Flash ตอนนี้ทำงานบนฟลีตของตัวเร่งความเร็ว AI สัญชาติจีนที่ผลิตในประเทศมากกว่า 100,000 ตัว ว่ามันเปลี่ยนจากการบูตครั้งแรกบนฮาร์ดแวร์นั้นมาสู่การรับภาระงานสดทั้งหมดในเวลาไม่ถึงสองสัปดาห์ และว่าทรูพุตแบบครบวงจรเพิ่มขึ้น 3.2 เท่าในช่วงเดียวกัน ส่วนที่เดินทางไกลที่สุดคือใครเป็นคนทำงาน งานส่วนใหญ่ไม่ได้ทำโดยทีมโครงสร้างพื้นฐาน แต่ทำโดยเอเจนต์ที่ขับเคลื่อนด้วย GLM-5.3 เอง ซึ่งอ่านคอขวด เสนอวิธีแก้ และเขียนโค้ดระบบอินเฟอเรนซ์ โดยมีวิศวกรกำหนดวัตถุประสงค์ สร้างสภาพแวดล้อมป้อนกลับ และตรวจสอบทุกอย่างที่แตะต้องความหมายเชิงตัวเลข ความพร้อมกัน หรือความเสี่ยงด้านโปรดักชัน GLM-5.3-Flash เป็นโมเดลมัลติโมดัลขนาดรวม 3.2 แสนล้าน พารามิเตอร์ เปิดใช้งาน 1.8 หมื่นล้าน (320B-A18B) ที่ Zhipu เปิดตัวและเปิดซอร์สเมื่อวันที่ 26 สิงหาคม 2026 — "Ox Alpha" นิรนามที่บริษัทเปิดเผยในวันนั้น — และพี่ใหญ่ของมัน GLM-5.3 คือเรือธง 743B ที่มันถูกตั้งราคาเทียบด้วย ไม่มีตัวเลขใดในสามตัวเลขจากการเปิดเผยวันนี้ที่มาจากเราหรือจากใครอื่น ทั้งหมดเป็นของ Zhipu เอง เรือธงไม่ใช่การเปรียบเทียบเดียวที่สำคัญอีกต่อไปเช่นกัน: บน ExploitBench การประเมินอิสระว่าโมเดลไต่บันไดช่องโหว่ Chrome จริงได้ไกลแค่ไหน GLM-5.3-Flash ตอนนี้ถูกวัดว่าอยู่ในระดับเดียวกับ Claude Mythos Preview โมเดลฟรอนเทียร์แบบปิดที่ผู้พัฒนาปล่อยให้เฉพาะผู้ป้องกันที่ผ่านการตรวจสอบเท่านั้น ด้วยต้นทุนต่อความพยายามที่เป็นเศษเสี้ยว
นั่นคือข่าวดี และมันเป็นเรื่องจริง แต่เป็นข้อมูลที่ผู้ขายกล่าวอ้าง มีอีกสามสิ่งที่เปลี่ยนแปลงไปตั้งแต่โพสต์นี้ถูกเผยแพร่ครั้งแรกในวันเปิดตัว และสองในนั้นไปในทางตรงกันข้าม Artificial Analysis ได้เผยแพร่การวัดของตนเองเกี่ยวกับโมเดลนี้แล้ว และตัวเลขของพวกเขาไม่ใช่ของ Zhipu ส่วนลดเปิดตัวที่ทำให้โมเดลนี้เป็นโมเดลที่มีความสามารถที่ถูกที่สุดในตลาดหมดอายุตามกำหนดเมื่อวันที่ 9 กันยายน และไม่ได้รับการต่ออายุ และหน่วยประเมินผลจากบุคคลที่สาม Generality Labs ได้เผยแพร่ผลการทดสอบ ExploitBench ของตนเอง ซึ่ง GLM-5.3-Flash ได้คะแนนสูงกว่าค่าเฉลี่ยสามครั้งของ Claude Mythos Preview บนบันไดเดียวกัน — ในราคาประมาณหกเซนต์ต่อดอลลาร์ สำหรับใครก็ตามที่บุ๊กมาร์กโมเดลนี้ไว้เมื่อปลายเดือนสิงหาคมว่า “ตัวถูก” คณิตศาสตร์วันนี้แตกต่างจากเมื่อก่อน และพาดหัวข่าวที่ซื่อสัตย์คือเรื่องที่คละกัน: เศรษฐศาสตร์การให้บริการดีขึ้นจริง ราคาสูงขึ้นเพราะโปรโมชั่นสิ้นสุดลง ตัวเลขความฉลาดที่ถูกอ้างถึงอย่างกว้างขวางไม่ผ่านการทดสอบครั้งแรกกับชุดทดสอบอิสระ และการเปรียบเทียบความสามารถที่เข้าทางโมเดลนี้เป็นการรันเดียวที่ยังไม่ผ่านการตรวจสอบ ซึ่งผู้เขียนเองก็บอกว่าไม่ควรตีความเกินเลย
Zhipu เป็นแหล่งข้อมูลเดียวสำหรับขนาดคลัสเตอร์ ไทม์ไลน์สองสัปดาห์ และตัวคูณ 3.2x — ไม่มีการตรวจสอบโดยอิสระสำหรับสิ่งใดในนั้น และบริษัทเองก็ระบุว่ายังไม่บรรลุการพัฒนาตนเองแบบเรียกซ้ำ โดยอธิบายผลลัพธ์ว่าเป็นวงจรขนาดเล็กที่สุดมากกว่าจะเป็นของจริง สิ่งที่ตรวจสอบได้ เราก็ตรวจสอบแล้ว: สิ่งประดิษฐ์ที่เป็นรูปธรรมเพียงชิ้นเดียวในบันทึกนี้ที่อยู่นอกกำแพงของ Zhipu — การแก้ไขความแม่นยำในเคอร์เนล Flash Linear Attention — ถูก merge เข้า upstream จริง และเราได้ยืนยันแล้ว เมื่อใดที่ตัวเลขด้านล่างมาจาก Zhipu ก็จะระบุไว้ เมื่อใดที่มาจาก Artificial Analysis ก็จะระบุว่าเป็นเช่นนั้นแทน เมื่อใดที่มาจาก Generality Labs — หน่วยประเมินความปลอดภัยที่อยู่เบื้องหลังตัวเลข exploit ในโพสต์นี้ — ก็จะระบุเช่นนั้น พร้อมข้อแม้ที่ผู้เขียนของพวกเขาแนบมาเอง: การรันหนึ่งครั้ง, บั๊ก 41 รายการ, วิธีการที่เผยแพร่เอง, ไม่มีการทำซ้ำโดยบุคคลที่สาม, และคำถามเรื่องการปนเปื้อนที่พวกเขายกขึ้นตามความคิดริเริ่มของตนเอง เมื่อใดที่ตัวเลขเป็นของ Anthropic — ตัวเลขเพียงชุดเดียวในที่นี้ที่มาจากแล็บซึ่งมีส่วนได้ส่วนเสียเชิงแข่งขันต่อคำตอบ — เนื้อความจะระบุว่าจริง ๆ แล้ววัดโมเดลใด เพราะไม่ใช่ทุกตัวที่จะเป็นโมเดลนี้
สิ่งที่ส่งมอบจริง
GLM-5.3-Flash เป็นโมเดล Mixture-of-Experts ขนาดรวม 320B / ใช้งานจริง 18B ที่มี 45 เลเยอร์ ซึ่งทำให้ขนาดการใช้งานจริงของมันมากกว่าครึ่งเล็กน้อยของ GLM-5.2 ที่มีประมาณ 32B ความสามารถเด่นคือการรองรับหลายรูปแบบ (modality): มันรับอินพุตข้อความ รูปภาพ และวิดีโอได้โดยตรง — เป็นโมเดล GLM-5 ตัวแรกที่ทำได้เช่นนี้ — แทนที่จะส่งภาพไปผ่านอะแดปเตอร์แยกต่างหาก คอนเท็กซ์สูงถึง 1 ล้านโทเค็น และ Zhipu อ้างว่าต้นทุนการให้บริการสำหรับคอนเท็กซ์ยาวอยู่ที่ประมาณหนึ่งในสามเมื่อเทียบกับ GLM-5.3
ในด้านสถาปัตยกรรม Zhipu อธิบายว่าเป็นโมเดลแนวหน้าระดับโอเพนซอร์สตัวแรกที่จับคู่ attention แบบไฮบริด sparse-plus-linear กับ Manifold-Constrained Hyper-Connections (mHC) สำหรับการขยายขนาด และกลไก IndexPool ที่บีบอัดเวกเตอร์คีย์ของ indexer สี่ตัวให้เป็นพูลแบบถ่วงน้ำหนักหนึ่งพูลเพื่อลดความหน่วงในบริบทยาว การพรีเทรนทำบนคลังข้อมูลมัลติโมดัลขนาด 30 ล้านล้านโทเคน ไม่มีสิ่งใดในนั้นที่ถูกตรวจสอบอย่างอิสระ — นี่คือ Zhipu ที่อธิบายโมเดลของตัวเอง — แต่ข้ออ้างเรื่องประสิทธิภาพการให้บริการนั้นเจาะจงพอที่จะทดสอบได้แล้วในเมื่อน้ำหนักโมเดลวางอยู่หน้าสแต็กการอนุมานแบบโอเพนซอร์ส และรายงานเมื่อวันที่ 17 กันยายนได้เพิ่มภาพโดยละเอียดชุดแรกว่าฝั่งการให้บริการถูกสร้างขึ้นจริงอย่างไร
เอกสารข้อมูลจำเพาะในวันเปิดตัว มองปราดเดียวก็รู้เรื่อง:
• พารามิเตอร์ — รวม 320B / ใช้งาน 18B, 45 เลเยอร์, MoE
• โมดาลิตี — อินพุตข้อความ รูปภาพ และวิดีโอแบบเนทีฟ; เอาต์พุตข้อความ
• หน้าต่างบริบท — สูงสุด 1,000,000 โทเคน
• สัญญาอนุญาต — MIT เผยแพร่น้ำหนักโมเดลบน Hugging Face ตั้งแต่วันเปิดตัว
• ราคา — $0.15 / $0.50 ต่อล้านโทเค็น (อินพุต / เอาต์พุต), $0.03 ต่อล้านโทเค็นอินพุตที่แคชไว้

การ์ดนั้นเป็นภาพ ณ วันเปิดตัว และมีสองแถวของมันที่เปลี่ยนไปแล้วนับตั้งแต่วันที่ 26 สิงหาคม ตัวเลข AA Index ยังคงเป็นข้ออ้างของ Zhipu เอง และตอนนี้ก็ถูกโต้แย้งด้วยผลการวัดที่เป็นอิสระ — รายละเอียดเพิ่มเติมด้านล่าง ราคาลดที่การ์ดแสดงไว้นั้นหมดไปแล้ว โปรโมชันสิ้นสุดเมื่อวันที่ 9 กันยายน ส่วนจำนวนพารามิเตอร์ หน้าต่างบริบท สัญญาอนุญาต และโมดัลลิตี้ ยังเป็นข้อเท็จจริงปัจจุบันที่ไม่ได้เปลี่ยนแปลง และสิ่งเหล่านี้คือสิ่งที่ภาพนี้มีไว้เพื่อนำเสนอเป็นหลัก
สัปดาห์ Ox Alpha และสิ่งที่ของแจกฟรีนั้นกำลังทดสอบอยู่จริงๆ
การเปิดเผยนี้ปิดฉากหนึ่งสัปดาห์แห่งการคาดเดา เมื่อวันที่ 20 สิงหาคม โมเดลนิรนามตัวหนึ่งปรากฏบนแพลตฟอร์ม AI API ของบุคคลที่สาม โดยมีหน้าต่างบริบทขนาด 1 ล้านโทเค็น รองรับอินพุตข้อความ/ภาพ/วิดีโอ และมีราคาเป็นศูนย์ และในไม่ช้ามันก็กลายเป็นโมเดลที่มีการเรียกใช้งานมากที่สุดในชาร์ตรายสัปดาห์ของแพลตฟอร์มนั้น ภายใน 48 ชั่วโมง ชุมชนได้ระบุลายนิ้วมือย้อนกลับไปยังตระกูล GLM ของ Zhipu ซึ่งเป็นรูปแบบการเปิดตัวแบบไม่ระบุชื่อแล้วค่อยออกมาอ้างสิทธิ์แบบเดียวกับที่เคยใช้ระบุโมเดลจากห้องปฏิบัติการจีนอื่น ๆ มาก่อน และนักวิเคราะห์คาดเดากันอย่างกว้างขวางว่าเป็น GLM-5.3 เวอร์ชัน Flash การประกาศเมื่อวันที่ 26 สิงหาคมยืนยันข้อสันนิษฐานว่า สัปดาห์ฟรีนั้นเป็นการทดสอบโดยเจตนา และบริษัทกล่าวว่าการรันแบบนิรนามได้ประมวลผลมากกว่า 62 ล้านล้านโทเค็นในหกวันบนแพลตฟอร์มเขียนโค้ดที่เปิดให้บริการ โดยทั้งหมดให้บริการจากชิปจีนในประเทศ
อนุประโยคสุดท้ายนั้นดูเหมือนเป็นเพียงเชิงอรรถในตอนนั้น แต่กลับกลายเป็นประเด็นสำคัญ สัปดาห์ฟรีไม่ได้มีจุดประสงค์หลักเพื่อเป็นกลเม็ดการตลาด หรือแม้แต่การทดสอบโหลดของโมเดล หากแต่เป็นการทดสอบโหลดของฟลีตตัวเร่งความเร็วที่รองรับมันอยู่ ซึ่งดำเนินการในระดับที่ความล้มเหลวจะกลายเป็นเรื่องสาธารณะและไม่มีค่าใช้จ่าย สามสัปดาห์ต่อมา Zhipu กำลังอธิบายว่าฟลีตเดียวกันนี้รองรับทราฟฟิกโปรดักชัน 100% ของโมเดล

ตรรกะการตั้งราคาของสัปดาห์นั้นยังคงใช้ได้ โดยมีการแก้ไขหนึ่งจุด รุ่นที่แจกฟรีในราคา $0 เป็นเวลาหนึ่งสัปดาห์ แล้วเปิดตัวในราคาหนึ่งในสิบของราคารุ่นเรือธง พร้อมส่วนลดอีก 50% เป็นการเคลื่อนไหวสร้างตลาดโดยเจตนาในระดับราคาประหยัด และคำขยายความ "ระยะเวลาจำกัด" คือส่วนที่ต้องจับตามองเสมอ เราเคยตั้งข้อสังเกตว่ามันเป็นสิ่งที่อาจถูกถอยกลับได้ มันถูกถอยกลับตามกำหนดเวลา — ซึ่งเป็นเรื่องที่ควรพูดให้ชัด เพราะการหมดอายุของส่วนลดคือการเปลี่ยนแปลงเพียงอย่างเดียวในเรื่องนี้ที่ปรากฏบนใบเรียกเก็บเงิน
สแตกการให้บริการที่เอเจนต์สร้างขึ้นใหม่
รายงานทางเทคนิคของ Zhipu ฉบับวันที่ 17 กันยายน เป็นคำอธิบายโดยละเอียดฉบับแรกว่า GLM-5.3-Flash ถูกให้บริการบนซิลิคอนจีนได้อย่างไร และข้ออ้างหลักของมันคือโมเดลหนึ่งช่วยปรับปรุงระบบที่รันมันอยู่ บริษัทเรียกกลไกนี้ว่าฟีดแบ็กแบบหนาแน่น: การทดสอบความถูกต้อง บันทึกการทำงาน เทรซ ไมโครเบนช์มาร์ก และเมตริกแบบต้นทางถึงปลายทาง ถูกเชื่อมต่อเข้าด้วยกันเพื่อให้เอเจนต์สามารถตรวจสอบสมมติฐานภายในเครื่องได้ แทนที่จะต้องรอการดีพลอยเต็มรูปแบบและการทดสอบโหลดหลังจากการเปลี่ยนแปลงทุกครั้ง เพื่อให้วิธีนี้ได้ผล Zhipu กล่าวว่าฟีดแบ็กต้องอยู่ภายในเครื่อง มีต้นทุนต่ำ และตรวจสอบได้อย่างเป็นภววิสัย — ผูกกับเคอร์เนลหรือเส้นทางโค้ดที่เจาะจง เร็วพอที่จะวนทำซ้ำได้ และเป็นจริงหรือเท็จได้โดยไม่ต้องมีมนุษย์อยู่ในวงจร
ด้วยวงจรนั้นที่ทำงานอยู่ เอเจนต์จึงค้นพบและแก้ไขสามสิ่งซึ่งบริษัทได้อธิบายไว้อย่างละเอียด:
• พาธแบบ context-parallel ในเคอร์เนล KDA สูญเสียความแม่นยำเมื่อลำดับยาวขึ้น เพราะ tl.dot มีค่าเริ่มต้นเป็น TF32 แม้ว่าอินพุตจะเป็น FP32 ทำให้ข้อผิดพลาดจากการปัดเศษทบ compounding ตามความยาวของ context การแก้ไขนี้ตรึงความแม่นยำของอินพุตไว้ที่ tf32x3 พร้อม fallback ไปที่ ieee บนแพลตฟอร์มที่ไม่รองรับ TF32 อันนี้เป็นข้อที่น่าสนใจที่สุดในสามข้อ เพราะเป็นข้อกล่าวอ้างเดียวในรายงานนี้ที่ออกนอกโครงสร้างพื้นฐานของ Zhipu เอง การเปลี่ยนแปลงนี้ถูก merge upstream ใน Flash Linear Attention เป็น PR #1180 ซึ่งเราได้ตรวจสอบและยืนยันแล้วว่า merge เมื่อวันที่ 27 สิงหาคม 2026
• การถ่ายโอน KV ไม่ได้ซ้อนทับกับการจัดตารางเวลาของ DeepEP ทั้ง intranode dispatch และ intranode combine ต่างก็ไม่ได้ปล่อย Python GIL ในเวอร์ชัน DeepEP ที่ใช้งานอยู่ ซึ่งทำให้เธรดการถ่ายโอนต้องติดค้างอยู่ด้านหลังการทำงานเหล่านี้ รายงานฉบับภาษาอังกฤษและฉบับภาษาจีนของงานเขียนชิ้นเดียวกันระบุว่าภาระส่วนเกินที่เกิดขึ้นสูงกว่า 20% และสูงกว่า 30% ตามลำดับ หลังการแก้ไข Zhipu กล่าวว่าช่องว่างเมื่อเทียบกับค่าพื้นฐานแบบ prefill-only ของตนลดลงต่ำกว่า 1%
• เคอร์เนลถอดรหัส (decode kernel) กำลังคำนวณการนอร์มัลไลเซชัน FP32 และการเกตเดิมซ้ำสี่ครั้ง โดยครั้งละหนึ่งไทล์มิติ V การแยกงานหารออกช่วยลดเวลาเคอร์เนลลง 9.6% และการรวมไทล์เข้าด้วยกันเป็นบล็อกเธรดเดียว — เพื่อให้การนอร์มัลไลเซชันทำงานเพียงครั้งเดียว — ให้ความเร็วเพิ่มขึ้น 1.71 เท่า
รายล้อมการแก้ไขเหล่านั้นคือการเปลี่ยนแปลงเชิงโครงสร้าง: ReplaySSM ซึ่งแลกพลังการประมวลผลกับหน่วยความจำบนชิป เนื่องจากตัวเร่งความเร็วมีหน่วยความจำบนชิปน้อยกว่า GPU ที่สแต็กนี้ถูกเขียนขึ้นมาเพื่อตั้งแต่แรก; การทำ tensor parallelism ภายในโหนดเพื่อบรรเทาแรงกดดันเดียวกัน; การแคชแบบผสม INT8, FP8 และ BF16 เพื่อขยายความจุ; และสถาปัตยกรรมแบบแยกส่วน Encode-Prefill-Decode ที่จัดตารางสามขั้นตอนการอนุมานแยกจากกันแทนที่จะเป็นไปป์ไลน์เดียว Zhipu ยังระบุข้อจำกัดอย่างตรงไปตรงมา — หน่วยความจำบนชิปและแบนด์วิดท์การเชื่อมต่อที่จำกัด ซอฟต์แวร์ที่ยังไม่สมบูรณ์ ความครอบคลุมของเคอร์เนลที่ไม่ครบถ้วน และเอกสารที่ไม่เพียงพอ — และกล่าวว่ามันยังไม่บรรลุการปรับปรุงตนเองแบบเรียกซ้ำ โดยอธิบายผลลัพธ์ว่าเป็นวงจรขนาดเล็กที่สุด
อ่านเรื่องเล่านี้อย่างตั้งข้อสงสัย เพราะแรงจูงใจนั้นชัดเจน Zhipu จะไม่บอกว่างานส่วนไหนเอเจนต์ทำ เทียบกับส่วนที่วิศวกรทำ และไม่มีการตรวจสอบจากภายนอกสำหรับตัวเลข throughput ไทม์ไลน์สองสัปดาห์ หรือขนาดคลัสเตอร์ การวางกรอบแบบ dense-feedback ก็เข้าข้างตัวเองในแบบเฉพาะเจาะจงเช่นกัน คือมันทำให้ข้ออ้างที่ฟังดูน่าประทับใจที่สุด ("โมเดลของเราพัฒนาตัวเองได้") ต้องอาศัยหลักฐานที่ตรวจสอบได้น้อยที่สุด (วงจรภายในที่ไม่มีใครตรวจสอบได้) สิ่งที่ทำให้เรื่องนี้ไม่ใช่การตลาดล้วน ๆ คือข้ออ้างที่ konkret ที่สุดของมันสามารถพิสูจน์ได้ว่าผิด และกลับกลายเป็นจริง — การแก้เคอร์เนล tf32x3 อยู่ในรีโพซิทอรี upstream จริง โดยลงวันที่ 27 สิงหาคม สามสัปดาห์ก่อนรอบข่าวประชาสัมพันธ์ที่เกี่ยวข้อง
มีค่าใช้จ่ายเท่าไรในหน่วยดอลลาร์จริง
เรตการ์ดนี้เป็นของ Zhipu และมันเรียบง่าย: $0.15 ต่อล้านโทเค็นอินพุต, $0.50 ต่อล้านโทเค็นเอาต์พุต และ $0.03 ต่อล้านโทเค็นอินพุตที่แคชไว้ นั่นคือราคาตามรายการ ณ วันนี้ โปรโมชันเปิดตัวลด 50% จัดไปจนถึงวันที่ 9 กันยายน 2026 และไม่ได้รับการขยายเวลา ดังนั้นตัวเลข $0.075 / $0.25 / $0.015 ที่แพร่หลายในช่วงปลายเดือนสิงหาคมจึงไม่มีให้ใช้อีกต่อไปบน API ของผู้ให้บริการเอง เมื่อเทียบกับราคาที่ประกาศของ GLM-5.3 ที่ $1.40 / $4.40 แล้ว Flash ยังคงอยู่ที่ประมาณหนึ่งในสิบเมื่อคิดตามราคาตามรายการ — ส่วนลดเป็นโบนัสเพิ่มเติมบนราคาที่เป็นประเด็นสำคัญอยู่แล้ว ไม่ใช่ตัวราคาเอง Artificial Analysis คำนวณอัตราแบบผสมไว้ที่ประมาณ $0.10 ต่อล้านโทเค็น จากอัตราส่วนแคชฮิต/อินพุต/เอาต์พุต 7:2:1 และระบุความเร็วเอาต์พุตไว้ที่ประมาณ 117 โทเค็นต่อวินาที ซึ่งอธิบายว่าเร็วอย่างน่าสังเกต แม้ว่า AA จะตั้งข้อสังเกตว่าตัวเลขความเร็วนั้นอธิบาย API แบบ first-party ของโมเดล ไม่ใช่การทดสอบที่ AA ดำเนินการเอง
เรื่องราวต้นทุนที่กว้างขึ้นของ Zhipu คือเหตุผลที่ราคาสามารถอยู่ตรงนั้นได้ ในผลประกอบการครึ่งปีที่เผยแพร่เมื่อวันที่ 31 สิงหาคม บริษัทกล่าวว่าต้นทุนการอนุมานต่อโทเคนหนึ่งหน่วยบนฝูงตัวเร่งความเร็วในประเทศจำนวน 100,000 ตัว ลดลง 80% นับตั้งแต่เริ่มปี 2026 และอัตรากำไรขั้นต้นของ API เพิ่มจาก -0.4% เป็น 24.6% อันเป็นผลจากขนาด ราคา และการให้บริการที่ถูกลง เหล่านี้เป็นตัวเลขของบริษัทจากบริษัทที่รายงานต่อผู้ถือหุ้น และไม่ได้ผ่านการตรวจสอบโดยเรา ถือว่าชี้ทิศทางได้ชัดเจนมากกว่าแม่นยำ คำอธิบายเรื่องการให้บริการข้างต้นคือกลไกเบื้องหลังข้อกล่าวอ้าง — การผ่านเคอร์เนลซ้ำซ้อนน้อยลง ความกดดันหน่วยความจำน้อยลง การซ้อนทับที่ดีขึ้น — ซึ่งเป็นเรื่องราวที่น่าเชื่อถือมากกว่าเปอร์เซ็นต์เปล่า ๆ แม้ว่าเปอร์เซ็นต์นั้นจะเป็นสิ่งที่ถูกอ้างถึงก็ตาม
คำกล่าวอ้างเรื่องประสิทธิภาพเมื่อเทียบกับเรือธงยังคงเดิม: ภาระการคำนวณของ attention ลดลง 3.0 เท่า และ KV cache ลดลง 4.4 เท่า เมื่อเทียบกับ GLM-5.3 ซึ่งเป็นตัวเลขที่ผู้ขายรายงานเอง โดย Zhipu ยอมรับว่า KV cache ของตนยังคงมีขนาดใหญ่กว่า DeepSeek V4 Flash และ Kimi K3 อยู่เล็กน้อย คำกล่าวอ้างตอนเปิดตัวว่าให้ประสิทธิภาพการเสิร์ฟแบบ end-to-end ดีขึ้น 3 เท่าบนชิปในประเทศ ตอนนี้ถูกระบุเป็น 3.2 เท่า โดยวัดจากครั้งแรกที่บูตจนถึงเมื่อมีทราฟฟิกการผลิตเต็มรูปแบบ ตัวเลขทั้งสองเป็นของ Zhipu และสองบัญชีที่อ้างอิงตัวเลขเหล่านั้นห่างกันสามสัปดาห์ ไม่มีสิ่งใดตรงนี้ที่ถูกทำซ้ำหรือตรวจสอบยืนยันได้จากภายนอกบริษัท
ทำไมการเปิดเผยจึงสำคัญ — และตัวเลขพาดหัวหายไปไหน
นี่คือการแก้ไขที่สำคัญที่สุดสำหรับใครก็ตามที่อ่านข่าวการเปิดตัวและจดจำตัวเลขนั้นไว้ เอกสารของ Zhipu ระบุว่า GLM-5.3-Flash อยู่ที่ 57 บน Artificial Analysis Intelligence Index เทียบเท่า Claude Opus 4.8 นับจากนั้น Artificial Analysis ได้เผยแพร่ผลการวัดของตนเองสำหรับโมเดลนี้บน Intelligence Index v4.3 และอ่านค่าได้ 42 เทียบกับ 47 ของ GPT-5.6 Sol (max) บนเวอร์ชันเดียวกัน ตัวเลข 57 ไม่เคยเป็นตัวเลขที่เป็นอิสระเลย มันเป็นของ Zhipu และการวัดที่เป็นอิสระวางโมเดลนี้ไว้ต่ำกว่ากลุ่มระดับที่ใกล้เคียงแนวหน้าสุดราวห้าคะแนน และต่ำกว่าตัวเลขพาดหัวของผู้ขายอย่างชัดเจน บนดัชนีปัจจุบันเดียวกันนี้ GLM-5.3 เองวัดได้ 45 ดังนั้นตัวเลข 60 สำหรับโมเดลเรือธงที่ปรากฏในข่าวการเปิดตัวของเราจึงไม่ตรงกับสิ่งที่ Artificial Analysis เผยแพร่ในวันนี้อีกต่อไป ช่องว่าง 15 คะแนนระหว่างคำกล่าวอ้างกับการวัดไม่ใช่ความต่างจากการปัดเศษ และมันเป็นสิ่งที่มีประโยชน์ที่สุดเพียงสิ่งเดียวที่ผู้อ่านจะได้จากอัปเดตนี้ — โดยมีข้อแม้หนึ่งประการที่หัวข้อด้านล่างเพิ่มเข้ามา เพราะการวัดที่เป็นอิสระครั้งที่สองในเรื่องนี้ชี้ไปในทางตรงกันข้าม
สิ่งที่ยังคงอยู่หลังการแก้ไขนั้นแคบลงแต่ก็ยังเป็นจริงอยู่ GLM-5.3-Flash เป็นโมเดลมัลติโมดัลแบบโอเพนเวทที่มีบริบท 1M และรองรับอินพุตรูปภาพและวิดีโอแบบเนทีฟในราคาประมาณหนึ่งในสิบของราคาตั้งของรุ่นพี่เรือธง — เป็นการรวมกันที่ไม่มีคู่เทียบโดยตรงจากห้องปฏิบัติการแนวหน้าของสหรัฐฯ ซึ่งโมเดลมัลติโมดัลที่เทียบเคียงได้มีราคาสูงกว่าอย่างมีนัยสำคัญและจำหน่ายแบบปิด กรอบของ Zhipu เองที่ว่า "ปัญญาระดับแนวหน้า ต้นทุนระดับแฟลช" คือส่วนที่ได้รับผลกระทบ: เมื่อวัดได้ 42 มันเป็นโมเดลราคาประหยัดที่แข็งแกร่ง ไม่ใช่โมเดลระดับแนวหน้าที่ลดราคา การวัดอิสระยังจัดให้มันอยู่เหนือค่ามัธยฐานสำหรับโมเดลโอเพนเวทที่มีขนาดใกล้เคียงกันอย่างสบาย ๆ ซึ่งเป็นความสำเร็จที่แท้จริงสำหรับโมเดลแอกทีฟ 18B ที่มีต้นทุนการอนุมานหนึ่งในสิบ — มันเป็นเพียงความสำเร็จที่แตกต่างจากที่การรายงานข่าวเปิดตัวสื่อให้เห็น
ตัวเลขอิสระอีกตัว — และมันก็ออกมาเข้าทางแบบจำลอง
ถ้าผลลัพธ์จาก Artificial Analysis ทำให้ GLM-5.3-Flash ดูด้อยลงไปหนึ่งขั้น อันนี้กลับกัน และมันคือข้อเท็จจริงที่แปลกที่สุดในเรื่องนี้ ExploitBench ซึ่งสร้างขึ้นที่ Carnegie Mellon ไม่ได้ถามว่าโมเดลสามารถทำให้เป้าหมายพังได้หรือไม่ แต่ให้คะแนนการไต่ระดับขึ้นไป ทั้งการเข้าถึงโค้ดที่มีช่องโหว่ การกระตุ้นให้บั๊กทำงาน การสร้าง primitive ที่นำกลับมาใช้ซ้ำได้ และสุดท้ายคือการยึดการควบคุมโฟลว์ทั้งหมดพร้อมรันโค้ดตามอำเภอใจ โดยให้คะแนนแบบกลไกล้วนเทียบกับ V8 เวอร์ชันโปรดักชันที่เปิด security sandbox ไว้ Generality Labs รัน GLM-5.3-Flash กับบั๊ก 41 ตัว โดยให้งบประมาณ 1 พันล้านโทเคนต่อบั๊กหนึ่งตัว แทนที่จะเป็นเพดาน 300 เทิร์นตามปกติของเบนช์มาร์ก ด้วยเหตุผลว่าเทิร์นเป็นตัวแทนที่แย่ของสิ่งที่ผู้ซื้อจ่ายจริง และดอลลาร์ต่างหากคือข้อจำกัดที่ซื่อตรง GLM-5.3-Flash ไปถึงการรันโค้ดตามอำเภอใจเต็มรูปแบบใน 13 จาก 41 ตัว และได้คะแนนความสามารถเฉลี่ย 64.8% ของค่าสูงสุดของบันไดคะแนนนี้ ส่วน Claude Mythos Preview ที่เผยแพร่ไว้สามรอบได้คะแนน 9, 10 และ 11 บนบันไดเดียวกัน — เฉลี่ย 10 หรือ 62.2% กรอบที่ Generality เองพิมพ์ไว้ใต้แผนภูมิคือ GLM-5.3-Flash “อาจอยู่ระดับ Mythos ในด้านไซเบอร์” ภายใต้การวัดนี้ ผลรัน ExploitBench ของ Anthropic เองที่เผยแพร่เมื่อวันที่ 29 กันยายน รายงานลำดับเดียวกันแต่ด้วยอัตราสัมบูรณ์ที่ต่ำกว่ามาก — อย่างไรก็ตาม เป็นผลของ GLM-5.3 รุ่นเรือธง ไม่ใช่รุ่น Flash โดยนับเป็น exploit แบบครบวงจรต่อความพยายามหนึ่งครั้ง แทนที่จะเป็นความคืบหน้าบนบันได และให้ GLM-5.3 อยู่ที่ 50 จาก 410 เทียบกับ Mythos Preview ที่ 56 จาก 410 กฎการนับต่างกัน ลำดับคล้ายกัน — ซึ่งเป็นเหตุผลพอดีว่าทำไมตัวเลขจาก ExploitBench ไม่ควรถูกอ้างโดยไม่ระบุกฎการนับกำกับไว้
เหตุผลที่สำคัญคือตัวส่วนที่รองรับอยู่ข้างใต้ การรันนี้คิดราคาโทเคนเอาต์พุตของ GLM-5.3-Flash ที่ $0.25 ต่อล้านโทเคน — อัตราเปิดตัวลด 50% ซึ่งหมดอายุไปแล้ว — เทียบกับอัตรา $125 ต่อล้านโทเคนในอดีตของ Claude Mythos Preview ซึ่งเป็นช่องว่าง 500 เท่า เมื่อคิดที่ต้นทุนเท่ากัน การรันนี้ใช้จ่าย $16.81 ต่อช่องโหว่หนึ่งรายการ เทียบกับ $297.17 ของ Mythos ซึ่งเป็นที่มาของตัวเลขราว 6% จงอ่านข้ออ้างนี้อย่างระมัดระวัง เพราะเวอร์ชันที่แพร่กระจายกันอยู่นั้นเป็นเวอร์ชันที่ผิด ไม่ใช่ว่า GLM-5.3-Flash เป็นนักพัฒนา exploit ที่เก่งกว่า Claude Mythos Preview แต่เป็นว่า หนึ่งดอลลาร์ของโทเคน GLM-5.3-Flash ให้ผลได้ประมาณเท่ากับที่หนึ่งดอลลาร์ของโทเคน Mythos ให้ในงานเฉพาะนี้ และคุณสามารถจ่ายเงินซื้อโทเคนของตัวแรกได้มากกว่าอีกหลายเท่า
ข้อแม้ของ Generality เองมีค่ามากกว่าพาดหัวข่าว พวกเขากล่าวอย่างตรงไปตรงมาว่า การรันเพียงครั้งเดียวไม่ได้พิสูจน์ความเท่าเทียมกันในภาพรวมของไซเบอร์ ว่าการปนเปื้อน (contamination) ยังเป็นคำถามที่เปิดอยู่ — ExploitBench อาจถูกใช้ฝึกโมเดลในลักษณะใดลักษณะหนึ่ง — และว่าตัวอย่าง 4 จาก 41 รายการเกิดข้อผิดพลาดและถูกให้คะแนนโดยนำผลลัพธ์ล่าสุดที่สังเกตได้มาใช้แทน ซึ่งถ้าจะมีผลอะไรก็ทำให้โมเดลดูต่ำกว่าความเป็นจริง พวกเขายังเผยแพร่บทความติดตามผลเมื่อวันที่ 28 กันยายน ซึ่งทำให้การเปรียบเทียบทั้งหมดซับซ้อนยิ่งขึ้น เมื่อรัน GLM-5.3-Flash ผ่านฮาร์เนสเอเจนต์ที่แตกต่างกันเจ็ดแบบด้วยงบประมาณ 250 ล้านโทเคน บนตัวอย่างสิบรายการที่เลือกมาเพื่อครอบคลุมช่วงความยาก น้ำหนักชุดเดียวกันได้คะแนน 10.6 ภายใต้ฮาร์เนส Codex — สูงกว่าค่าอ้างอิง 10.02 ของ Claude Mythos Preview — และ 6.2 ภายใต้ฮาร์เนส Claude Code ซึ่งต่ำแม้แต่การกำหนดค่าแบบจำกัดเทิร์นดั้งเดิมของ benchmark ที่ 6.4 ฮาร์เนสทำให้คะแนนเปลี่ยนไปมากกว่าการเปรียบเทียบโมเดล และผู้เขียนกล่าวว่าชุดย่อยสิบตัวอย่างนี้อาจไม่เป็นตัวแทน การที่กราฟนี้ถูกเผยแพร่ไปอย่างกว้างขวางเมื่อวันที่ 2 ตุลาคม พร้อมข้อโต้แย้งที่ว่า การสเกลพลังประมวลผลตอนทดสอบกำลังลบช่องว่างระหว่างระดับของโมเดลนั้น เป็นข้อกล่าวอ้างเกี่ยวกับอุตสาหกรรม ไม่ใช่ข้อค้นพบจากการประเมิน สิ่งที่การประเมินพบคือ โมเดลเปิดราคาถูก เมื่อได้รับงบประมาณแทนการจำกัดเทิร์น สามารถไปถึงระดับผู้เชี่ยวชาญด้าน exploit ของห้องแล็บชั้นแนวหน้าบน ladder หนึ่งได้
มันไม่ใช่เรื่องราวของห้องแล็บเดียวอีกต่อไป การประเมิน Frontier Red Team ของ Anthropic เอง ซึ่งเผยแพร่เมื่อวันที่ 29 กันยายน ได้รัน GLM-5.3-Flash — รุ่นน้องที่เล็กกว่า — ในเซสชันแบบมีมนุษย์อยู่ในวงจร: เมื่อมอบรายละเอียดสาธารณะของช่องโหว่ Chrome ที่ได้รับการแพตช์แล้วบวกกับอีกหนึ่งรายการ โดยไม่มีคำแนะนำที่มีนัยสำคัญ โมเดลได้นำสิ่งเหล่านั้นมาต่อกันเป็น exploit ARM64 ที่เชื่อถือได้ ซึ่งหลบเลี่ยงการเสริมความแข็งแกร่งของการพิสูจน์ตัวตนพอยน์เตอร์ได้ ภายในเวลา 20 นาทีของความสนใจจากมนุษย์และ 8 ชั่วโมงของการทำงานของโมเดล — 20.40 ดอลลาร์ตามอัตราค่า API ของ Zhipu การประเมินเดียวกันนี้เป็นแหล่งที่มาของตัวเลข 50 จาก 410 ใน ExploitBench ข้างต้น และส่วนนั้นวัด GLM-5.3 ซึ่งเป็นเรือธงขนาด 743B ไม่ใช่ Flash — ความแตกต่างที่การรายงานข่าวเกี่ยวกับรายงานนี้ทำให้เลือนหายไปเป็นส่วนใหญ่ สองฝ่ายที่เป็นอิสระต่อกัน ใช้ฮาร์เนสต่างกัน งบประมาณต่างกัน แต่ทิศทางเดียวกัน ทั้งสองยังเป็นการรันในห้องแล็บเพียงครั้งเดียว และไม่มีอันใดเป็นผลลัพธ์ที่ทำซ้ำได้ และมีเพียงการรันของ Generality เท่านั้นที่รายงานตัวเลขดอลลาร์สำหรับ Flash ไม่ใช่สำหรับรุ่นเรือธง การตีความในทางปฏิบัติคือสิ่งที่ Anthropic ระบุอย่างตรงไปตรงมา: น้ำหนักโมเดลนั้นดาวน์โหลดได้ การทำ abliteration กับ GLM-5.3-Flash ใช้เวลาประมาณ 600 ชั่วโมง GPU และโมเดลที่มีต้นทุนต่ำกว่าหนึ่งดอลลาร์ต่อชั่วโมงในการรันเป็นปัญหาด้านการเข้าถึงที่แตกต่างจากโมเดลที่อยู่เบื้องหลังโปรแกรมการตรวจสอบคัดกรอง
ลองดูสิ และชั้นการกำหนดเส้นทางเข้ากันได้อย่างไร
การเข้าถึงนั้นตรงไปตรงมา API ของ Zhipu เองให้บริการในอัตราตามรายการข้างต้น น้ำหนักโมเดลที่ได้รับสัญญาอนุญาตแบบ MIT อยู่บน Hugging Face ที่ zai-org/GLM-5.3-Flash ในรูปแบบ FP8 และ BF16 และผลิตภัณฑ์สำหรับการเขียนโค้ดของ Zhipu — ZCode และ GLM Coding Plan — ก็รวมโมเดลนี้ไว้ด้วย สำหรับการโฮสต์เอง ทั้ง vLLM และ SGLang ต่างก็รองรับ ข้อควรทราบในทางปฏิบัติสองประการหากคุณเลือกเส้นทางนั้น: cookbook ของ SGLang มีคำเตือนการเปลี่ยนแปลงที่ยังเปิดอยู่ว่าอินพุตภาพอาจถูกทิ้งไปอย่างเงียบ ๆ บนบิลด์ transformers ก่อน 5.13 ซึ่งจะไม่แจ้งข้อผิดพลาดใด ๆ และจะให้ผลเป็นการอ่านคำขอรูปภาพแบบข้อความล้วนเท่านั้น และเส้นทาง AMD ยังไม่ถือเป็นสูตรที่พร้อมใช้ PR การเปิดใช้งาน gfx950 ในวันเปิดตัวครั้งแรก (sgl-project/sglang #37653) ถูกปิดโดยไม่ได้รวมโค้ดเมื่อวันที่ 6 กันยายน และถูกแทนที่ด้วยชุด pull request สำหรับ gfx950 แบบ day-zero ที่ครอบคลุมกว่า — mHC ผ่าน AITER, อินเด็กเซอร์ k-pool DSA, การให้บริการ FP8 และ MXFP4 — ซึ่งหลายรายการยังเปิดอยู่ ณ วันที่ 17 กันยายน การเปิดใช้งานบนฮาร์ดแวร์ระดับ MI350X อยู่ระหว่างดำเนินการ ยังไม่เปิดให้ใช้งานจริง และยังไม่มีตัวเลขปริมาณงานของ AMD ที่เป็นอิสระ
ในด้านการจัดเส้นทาง สถานการณ์เปลี่ยนไปตั้งแต่เปิดตัว: GLM-5.3-Flash ตอนนี้อยู่ในรายชื่อของ OrcaRouter แล้ว พร้อมกับโมเดลอื่น ๆ ในตระกูล GLM เรามีการส่งผ่านราคาตั้งต้นของผู้ให้บริการโดยบวกเพิ่ม 0% และไม่มีค่าธรรมเนียมเพิ่มเติมจากเราเตอร์ ซึ่งเป็นกลไกที่สำคัญพอดีสำหรับโมเดลที่ราคาเพิ่งเปลี่ยนไป — ส่วนลดที่กำลังหมดอายุฝั่ง Zhipu คือราคาที่คุณจ่ายที่นี่ ในวันเดียวกัน โดยไม่ต้องเจรจาสัญญาฉบับที่สองและไม่ต้องแก้โค้ด การส่งผ่านราคาแบบนี้มีสองด้าน และก็ควรพูดให้ชัดเจนว่า โปรโมชันที่หมดอายุคือการขึ้นราคาจริงในบิลของคุณ และมันเกิดขึ้นที่นี่ในจังหวะเดียวกับที่เกิดขึ้นที่ต้นทาง ถ้าคุณกำลังชั่งน้ำหนักระหว่าง Flash กับ GLM-5.3 หรือโมเดลราคาประหยัดอื่น ทั้งสองอยู่หลังคีย์เดียวโดยมีระบบสลับอัตโนมัติระหว่างผู้ให้บริการ ซึ่งเป็นวิธีที่ประหยัดในการลองโมเดลที่คะแนนอิสระยังไม่นิ่ง โดยไม่ต้องเดิมพันเส้นทาง production กับมัน นอกจากนี้ยังเป็นรูปแบบที่เหมาะสมกับผลลัพธ์ข้างต้น และด้วยเหตุผลที่ตรงไปตรงมากกว่าความสะดวก: น้ำหนักชุดเดียวกันได้คะแนน 10.6 หรือ 6.2 บนเบนช์มาร์กเดียวกัน ขึ้นอยู่กับว่า agent harness ตัวไหนขับมัน ดังนั้นสิ่งที่ผู้ซื้อทดสอบจริง ๆ คือการผสมกันของ scaffold บวกโมเดล และการสลับโมเดลที่อยู่เบื้องหลัง scaffold คงที่ภายใต้คีย์เดียวก็ถูกกว่าการตัดสินใจเลือกอย่างใดอย่างหนึ่ง

สิ่งที่ควรดูต่อไป
สี่สิ่งที่จะชี้ขาดส่วนที่เหลือของเรื่องนี้ ประการแรก ว่า 42 จะขยับหรือไม่: โมเดลนี้ถูกใช้งานสาธารณะอย่างแพร่หลายตั้งแต่เดือนสิงหาคม ดังนั้นหากการประเมินภายในของ Zhipu และชุดทดสอบของ AA ขัดแย้งกันด้วยเหตุผลเชิงโครงสร้าง — การนับโทเค็นการให้เหตุผล ความยาวของคำตอบ การประเมินที่ผู้ขายให้น้ำหนักอย่างมาก — สิ่งนั้นควรปรากฏเมื่อดัชนีถูกปรับปรุง แทนที่จะเป็นช่องว่างเพียงครั้งเดียว ประการที่สอง ว่าผลลัพธ์ exploit ทำซ้ำได้หรือไม่ Generality Labs รันบั๊ก 41 รายการเพียงครั้งเดียว บนชุดทดสอบของตัวเอง และกล่าวเช่นนั้น การติดตามผลด้วยชุดทดสอบแสดงให้น้ำหนักเดียวกันขยับสี่จุดเพียงเพราะการเลือกชุดทดสอบเท่านั้น ดังนั้นตัวเลขที่จะชี้ขาดได้คือทีมที่สองรัน 41 ซ้ำ โดยกำหนดงบประมาณเป็นดอลลาร์และตรึงชุดทดสอบให้คงที่ ประการที่สาม ว่าเรื่องเล่าเกี่ยวกับซิลิคอนในประเทศจะได้แหล่งข้อมูลที่สองหรือไม่ Zhipu เป็นฝ่ายเดียวที่สามารถระบุขนาดคลัสเตอร์ ไทม์ไลน์สองสัปดาห์ และตัวคูณ 3.2x และข้ออ้างเดียวที่ตรวจสอบได้อย่างอิสระในนั้น — การแก้ไขเคอร์เนลที่รวมแล้ว — เป็นเรื่องเล็ก ประการที่สี่ ราคา: ส่วนลดหมดไปแล้ว และคำถามที่น่าสนใจคือมันจะกลับมาในรูปแบบโปรโมชันเมื่อ Zhipu ต้องการปริมาณ หรือราคาตามรายการกลายเป็นพื้นราคาในตอนนี้
แก่นเรื่องก็คือ GLM-5.3-Flash ถูกขอให้พิสูจน์สองสิ่งที่ต่างกันในเวลาเดียวกัน — ว่าโมเดลราคาถูกสามารถดีพอได้ และว่าตัวเร่งความเร็วของจีนสามารถให้บริการมันในระดับสเกลได้ — และการเปิดเผยเมื่อวันที่ 17 กันยายนคือคำตอบของ Zhipu ต่อคำถามข้อที่สอง ซึ่งนำเสนอโดยโมเดลที่มีส่วนช่วยเขียนคำตอบนั้น คำถามข้อแรกตอนนี้มีตัวเลขอิสระสองตัวแนบมาด้วย และพวกมันชี้ไปในทิศทางตรงกันข้าม: คะแนน 42 บนดัชนีความฉลาด ซึ่งต่ำกว่าตัวเลขพาดหัวของผู้ขายมาก และการรัน exploit ที่ได้ระดับเดียวกับผู้เชี่ยวชาญเฉพาะทางของแล็บชั้นแนวหน้า ด้วยต้นทุนเพียงหนึ่งในยี่สิบ ทั้งสองอย่างเป็นจริงพร้อมกันได้ และช่องว่างระหว่างพวกมัน — ไม่ใช่ตัวเลขใดตัวหนึ่ง — คือจุดที่การตัดสินใจเกิดขึ้นจริง
การเปรียบเทียบในบทความนี้1
ตรวจพบจากบทความนี้ · เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
