
Claude Haiku 5.5 กับ GLM 5.3 Flash: สูสีกันพอดีบนเบนช์มาร์กที่ทั้งสองค่ายอ้างถึง
- openaiใหม่OpenAI: GPT-6.1 Sol2026-09-2952ความฉลาด
- anthropicใหม่Anthropic: Claude Sonnet 5.52026-09-2856ความฉลาด
- typesafeใหม่TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 ต่อ 1 ล้านโทเค็น · 128 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238ความฉลาด
- OpenAIOpenAI: GPT-6 Sol2026-09-2248ความฉลาด
- AnthropicAnthropic: Claude Opus 5.52026-09-2258ความฉลาด
- xAIGrok 4.72026-09-2146ความฉลาด
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 ต่อ 1 ล้านโทเค็น · 60 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 ต่อ 1 ล้านโทเค็น · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040ความฉลาด
- OpenAIOpenAI: GPT-6 Astra2026-09-0453ความฉลาด77การเขียนโค้ด
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241ความฉลาด76การเขียนโค้ด
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245ความฉลาด76การเขียนโค้ด
- AnthropicAnthropic: Claude Fable 5.12026-09-0153ความฉลาด82การเขียนโค้ด
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 ต่อ 1 ล้านโทเค็น · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น · 356 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642ความฉลาด72การเขียนโค้ด
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 ต่อ 1 ล้านโทเค็น · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845ความฉลาด75การเขียนโค้ด
- obsidianQwen3.8 27B2026-08-1534ความฉลาด68การเขียนโค้ด
Run Claude Haiku 5.5 and GLM 5.3 Flash through Terminal Bench 4.0 and you get the same number: 0.32828 for both. Not close — identical, to five decimal places, on the benchmark that the vendor leads with in its own launch materials and that Z.ai's launch materials lead with too. For two models built on entirely different stacks, by vendors in different countries, released six weeks apart, that is a coincidence worth stopping on.
มันยังเป็นตัวเลขที่ผิดที่จะใช้ตัดสินใจด้วย โมเดลทั้งสองแยกจากกันอย่างชัดเจนในด้านอื่นทั้งหมด และรูปแบบของการแยกจากกันนั้นแปลกพอที่จะเปลี่ยนวิธีที่คุณตีความคำกล่าวอ้างหลักของผู้ขายแต่ละราย หนึ่งในนั้นชนะดัชนีคอมโพสิตและตัวเลขต้นทุนต่องาน ส่วนอีกตัวชนะเกือบทุกอย่างที่ดูเหมือนการนำไปใช้งานจริง
พวกเขาไม่ได้แยกจากกันด้วยความสามารถ พวกเขาแยกจากกันด้วยรูปร่าง
เริ่มจากตัวเลขตัวเดียวที่บอกว่า "นี่คือโมเดลประเภทเดียวกัน"
• SciCode — 0.5498 สำหรับ Claude Haiku 5.5 เทียบกับ 0.5162 สำหรับ GLM 5.3 Flash สองคะแนนให้ Anthropic บนเบนช์มาร์กที่สองคะแนนเป็นเพียงสัญญาณรบกวน
• Terminal Bench 4.0 — 0.32828 กับ 0.32828 เสมอกันพอดี
• หน้าต่างบริบท — หนึ่งล้านโทเค็นสำหรับทั้งสอง
• ราคาเอาต์พุต ชั้นแรก — 0.50 ดอลลาร์ต่อล้านโทเคนสำหรับทั้งสอง
สี่แถว สี่ค่าที่ใกล้เคียงกันมาก หากคุณหยุดตรงนี้ คุณคงสรุปว่าโมเดลเหล่านี้ใช้แทนกันได้ และเลือกจากราคา ข้อสรุปนั้นผิด และชุดแถวถัดไปคือคำตอบว่าทำไม
ในจุดที่พวกมันแยกออกจากกัน ทิศทางยังคงสอดคล้องกัน
แถวที่แยกทั้งสองออกจากกันได้จริงนั้นไม่ได้กระจัดกระจาย มันรวมกลุ่มกันเป็นสองกลุ่ม และแต่ละโมเดลเป็นเจ้าของกลุ่มหนึ่งไปโดยสิ้นเชิง
กลุ่มเอเจนติกเป็นของ GLM 5.3 Flashคะแนนบางส่วนของ AutomationBench อยู่ที่ 0.6037 สำหรับ GLM 5.3 Flash เทียบกับ 0.3541 สำหรับ Claude Haiku 5.5 — ห่างกัน 25 จุด ซึ่งเป็นความแตกต่างรายการเดียวที่ใหญ่ที่สุดระหว่างสองโมเดลนี้ในทุกการวัดที่มีร่วมกัน Tau-Bench Banking อยู่ที่ 0.4722 สำหรับ GLM 5.3 Flash; Claude Haiku 5.5 ไม่มีตัวเลขที่เผยแพร่ในแถวนั้น GPQA อยู่ที่ 0.9121 สำหรับ GLM 5.3 Flash; เช่นเดียวกัน ไม่มีตัวเลขของ Anthropic ให้เปรียบเทียบ ในด้านการวัดว่าโมเดลสามารถรักษางานหลายขั้นตอนให้ต่อเนื่องกันได้และใช้เครื่องมือได้อย่างเชื่อถือได้ภายในโดเมนที่มีโครงสร้าง โมเดลของ Z.ai นำอยู่ด้วยส่วนต่างที่มากกว่าความแตกต่างของดัชนีรวมที่ไปในทิศทางตรงกันข้ามอย่างเทียบกันไม่ติด
กลุ่มคะแนนรวมและต้นทุนเป็นของ Claude Haiku 5.5ดัชนี Artificial Analysis Intelligence Index v4.3.2 อยู่ที่ 43.40 เทียบกับ 41.81 — ต่างกัน 1.59 คะแนน และเป็นตัวเลขที่ทุกบทสรุปของการเปรียบเทียบนี้ยกมาอ้าง ต้นทุนต่องาน Index ที่ทำเสร็จอยู่ที่ $0.21 เทียบกับ $0.25 เวลาตามนาฬิกาต่องาน Index อยู่ที่ 424.6 วินาที เทียบกับ 1,035.4 วินาที: โมเดลของ Anthropic ทำงานเสร็จในเวลาไม่ถึงครึ่ง
นั่นคือรูปร่างของทางเลือกนี้ Claude Haiku 5.5 เร็วกว่า ถูกกว่าต่องานที่เสร็จสมบูรณ์แต่ละงาน และมีคะแนนรวมสูงกว่า GLM 5.3 Flash เชื่อถือได้มากกว่าในงานประเภทเฉพาะที่โมเดลราคาถูกถูกซื้อมาใช้

อันไหนคืออันที่ควรเชื่อ
ไม่ใช่อย่างใดอย่างหนึ่งโดยลำพัง — และความไม่ลงรอยกันนั้นเองคือข้อมูล
Intelligence Index คือการผสมผสานแบบถ่วงน้ำหนักครอบคลุมหมวดหมู่การให้เหตุผล วิทยาศาสตร์ การเขียนโค้ด และเอเจนต์ มันถูกออกแบบมาเพื่อตอบคำถามว่า "โมเดลนี้มีความสามารถประมาณไหน" ในตัวเลขเดียว และมันก็ทำหน้าที่นั้นได้ สิ่งที่มันทำไม่ได้คือบอกคุณว่าคะแนนนำ 1.59 จุดนั้นมาจากหมวดหมู่ที่งานของคุณใช้งานอยู่ หรือมาจากหมวดหมู่ที่มันไม่เคยแตะต้อง ในที่นี้ คะแนนนำนั้นมาจากแถวอย่าง SciCode และ Humanity's Last Exam เป็นส่วนใหญ่ — 0.5498 ต่อ 0.5162 และ 0.4439 ต่อ 0.3985 — ในขณะที่คะแนนที่ด้อยกว่า 25 จุดอยู่ที่ AutomationBench ซึ่งมีเครื่องหมายตรงกันข้าม
ทีมที่สร้างผู้ช่วยเขียนโค้ดบนลูปเทอร์มินัลจะสังเกตเห็นความได้เปรียบของ SciCode ทีมที่สร้างเอเจนต์ซึ่งต้องทำเวิร์กโฟลว์ด้านธนาคารให้เสร็จครบวงจรจะสังเกตเห็นช่องว่างของ AutomationBench และจะสังเกตเห็นมันทุกวันโดยไม่มีเว้น ทั้งสองทีมกำลังมองดัชนีเดียวกัน และควรได้ข้อสรุปที่ตรงกันข้าม
วิธีที่ใช้ได้จริงคืออ่านคะแนนรวมเป็นตัวกรองมากกว่าการจัดอันดับ หากสองโมเดลมีค่าต่างกันไม่เกินประมาณสองพอยต์ของดัชนี คะแนนรวมก็บอกคุณว่าพวกมันอยู่ในช่วงเดียวกัน และไม่ได้บอกอะไรเลยว่าควรเลือกอันไหน ณ จุดนั้น แถวที่คุ้มค่าแก่การอ่านมีเพียงแถวที่ตรงกับภาระงานของคุณเท่านั้น — และหากผู้จำหน่ายไม่ได้เผยแพร่แถวที่คุณต้องการ การไม่มีแถวนั้นก็เป็นจุดข้อมูลในตัวเอง ไม่ใช่ช่องว่างที่จะเติมด้วยสมมติฐาน
บรรทัดเรื่อง tokenizer ที่ไม่มีใครใส่ลงในตารางเปรียบเทียบ
เอกสารของ Anthropic เองมีอยู่หนึ่งประโยคที่เปลี่ยนการเปรียบเทียบราคาทุกครั้งที่เกี่ยวข้องกับ Claude Haiku 5.5 และเป็นเรื่องง่ายมากที่จะอ่านข้ามไป โมเดลนี้ใช้โทเคไนเซอร์รุ่นใหม่ที่ใช้ร่วมกับ Claude 4.7 และรุ่นหลังจากนั้น ซึ่งนับข้อความเดียวกันออกมาเป็นโทเคนมากกว่าโมเดลที่มันมาแทนที่ราว 30%
พอนำมาเทียบกับตารางราคา ตัวเลขที่คำนวณได้ก็ดูไม่สวยหรูเท่าที่ป้ายราคาบอก อัตราอินพุตของ Claude Haiku 5.5 อยู่ที่ $0.10 ต่อล้านโทเคน เทียบกับ $0.15 ของ GLM 5.3 Flash — ได้เปรียบ 1.5 เท่า หากใช้โทเคนมากกว่า 30% สำหรับพรอมป์ต์เดียวกัน ความได้เปรียบที่แท้จริงบนข้อความเดียวกันก็ลดลงอย่างมาก แม้จะไม่หายไป อัตราเอาต์พุตเท่ากันที่ $0.50 ในระดับแรก ดังนั้นผลจากโทเคไนเซอร์จึงมีผลโดยไม่มีอะไรมาชดเชยในส่วนนั้น
ผลลัพธ์ที่วัดได้คือข้อกล่าวอ้างฉบับที่ตรงไปตรงมา: ตามการคำนวณของ Artificial Analysis เอง Claude Haiku 5.5 สร้างโทเคนเอาต์พุต 162,164 โทเคนต่องาน Index เทียบกับ 68,673 โทเคนของ GLM 5.3 Flash — มากกว่า 2.4 เท่า — และยังออกมาเป็น $0.21 ต่อหนึ่งงานที่เสร็จสิ้น เทียบกับ $0.25 ข้อได้เปรียบด้านอัตราค่าใช้จ่ายยังคงอยู่แม้จะมีความยาวเยิ่นเย้อ และสิ่งที่เหลืออยู่ของข้อได้เปรียบนั้นก็น้อยกว่าที่ตารางราคาบอกไว้
มีเพียงหนึ่งในสองตัวนี้เท่านั้นที่ระบุอัตราของตนเป็นแบบคงที่ ราคาของ Claude Haiku 5.5 จะปรับขึ้นเมื่อพรอมป์ต์เกิน 100,000 โทเค็น เป็น $0.50 สำหรับอินพุตและ $2.50 สำหรับเอาต์พุต ส่วน GLM 5.3 Flash ไม่ได้เผยแพร่เกณฑ์ที่เทียบเท่ากัน สำหรับทราฟฟิกแชทและงานช่วยเขียนโค้ดส่วนใหญ่ ขั้นราคานั้นไม่เคยมีผล แต่สำหรับงานเอกสารยาวหรือเอเจนต์ที่ใช้บริบทขนาดใหญ่ มันมีผลอยู่ตลอด และเมื่อถึงจุดนั้น การเปรียบเทียบก็พลิกกลับไปไกลเกินกว่าที่ตัวเลขระดับแรกจะบอกเป็นนัย

เส้นที่ตัดสินก่อนที่ตัวเลขใด ๆ จะตัดสิน
ทั้งหมดที่กล่าวมาข้างต้นตั้งอยู่บนสมมติฐานว่าคุณสามารถเลือกได้อย่างอิสระระหว่างสองโมเดลนี้ ทีมจำนวนมากไม่สามารถทำเช่นนั้นได้ และสาเหตุก็คือแถวในสเปกชีตเพียงแถวเดียวที่การถกเถียงเรื่องเบนช์มาร์กมักกลบไว้
GLM 5.3 Flash เป็นโมเดลแบบเปิดน้ำหนัก เปิดตัวภายใต้สัญญาอนุญาต MIT มีพารามิเตอร์ทั้งหมด 320 พันล้านตัว โดยมีการใช้งานจริง 18 พันล้านตัว สามารถดาวน์โหลด โฮสต์เอง ไฟน์จูน ควอนไทซ์ ปักหมุดไว้กับเวอร์ชันหนึ่ง และรันภายในเทนแนนซีที่คุณควบคุมเองได้ Claude Haiku 5.5 เป็นโมเดลกรรมสิทธิ์เฉพาะและใช้ผ่าน API เท่านั้น ไม่มีการเปิดเผยจำนวนพารามิเตอร์ ไม่มีสัญญาอนุญาต และไม่มีรีพอซิทอรี
หากเอกสารข้อกำหนดของคุณระบุว่าโมเดลต้องรันบนฮาร์ดแวร์ของคุณเอง หรือระบุว่าเช็กพอยต์ตัวใดตัวหนึ่งต้องยังคงเรียกใช้งานได้ต่อไปอีกสามปี การเปรียบเทียบนี้ก็จบลงตั้งแต่ยังไม่ทันได้อ่านคอลัมน์ราคา นั่นไม่ใช่ข้อปลีกย่อยทางเทคนิค มันเป็นเหตุผลที่พบบ่อยที่สุดที่ทำให้ทีมต่าง ๆ ลงเอยกับโมเดลระดับกลางแบบ open-weights และเป็นเหตุผลที่ว่าความได้เปรียบ 25 คะแนนบน AutomationBench ไม่ใช่สิ่งเดียวที่ดึงไปในทิศทางของ Z.ai
มันก็ใช้ได้ในทางกลับกันเช่นกัน และความซื่อตรงแบบเดียวกันก็ใช้ด้วย Anthropic เผยแพร่คำมั่นเรื่องการปลดระวาง Claude Haiku 5.5 ว่าจะไม่เร็วไปกว่าตุลาคม 2027 และให้บริการโมเดลนี้บน API ของบริษัทเอง พร้อม system card และชุดการประเมินที่มีเอกสารประกอบ การเปิดเผยน้ำหนักโมเดลแบบ open-weights ไม่ได้หมายความว่าจะยั่งยืนกว่าโดยอัตโนมัติ — คุณต้องรับภาระด้านปฏิบัติการมาพร้อมกับน้ำหนักโมเดล และไฟล์สัญญาอนุญาตไม่ใช่สัญญาสนับสนุน การจะเลือกแบบไหนในสองแบบนั้นเป็นคำถามเกี่ยวกับทีมของคุณ ไม่ใช่เกี่ยวกับตัวโมเดล
ทั้งสองฝ่ายบนปุ่มเดียว ถ้าคุณอยากตัดสินด้วยหลักฐานเชิงประจักษ์
GLM 5.3 Flash อยู่ในแคตตาล็อกของ OrcaRouter ในราคาตามรายการของ Z.ai โดยมีมาร์กอัป 0% ส่งผ่านราคาตรง ๆ แทนที่จะนำไปผสมรวม ดังนั้นเรตข้างต้นคือเรตที่คิดในบิล และการเปลี่ยนแปลงใด ๆ ที่ Z.ai ทำ จะมีผลกับฝั่งเราในวันเดียวกันClaude Haiku 5.5 ไม่ได้อยู่ในแคตตาล็อกของเรา — แต่สามารถเข้าถึงได้ผ่าน API ของ Anthropic เอง — และเป็นการดีกว่าที่จะระบุเช่นนั้น มากกว่าปล่อยให้ต้องอนุมานเอง
สิ่งที่แคตตาล็อกทำให้เป็นเรื่องง่ายก็คือรูปร่างของการทดสอบที่การจับคู่นี้เรียกร้องจริง ๆ ความไม่ลงรอยกันระหว่างดัชนีคอมโพสิตกับแถวแบบเอเจนต์คือสมมติฐานเกี่ยวกับเวิร์กโหลดของคุณ และวิธีเดียวที่จะไขข้อนี้ได้คือรันทั้งสองโมเดลบนเทรซเดียวกัน เมื่อมี GLM 5.3 Flash อยู่บนเส้นทางและขา Anthropic อีกด้านของเกตเวย์เดียวกัน เรื่องนี้ก็กลายเป็นแค่การเปลี่ยนคอนฟิกแทนที่จะเป็นการผสานรวมสองอย่าง — API เดียวสำหรับโมเดลกว่า 200 ตัว คีย์เดียว การสลับสำรองอัตโนมัติอยู่ข้างใต้ และ DSL สำหรับกำหนดเส้นทางเมื่อคุณต้องการแยกทราฟฟิกตามคลาสของงานและอ่านค่าใช้จ่ายจากใบแจ้งหนี้ใบเดียว

คำตัดสินที่กล่าวไว้ในแบบที่ตัวเลขสนับสนุน
ถ้างานของคุณเป็นข้อความเข้า ข้อความออก พรอมต์ของคุณยังอยู่ในระดับราคาแรก และคุณจ่ายตามโทเคนสำหรับปริมาณงานจริง Claude Haiku 5.5 คือโมเดลที่ดีกว่าในกรณีนี้: คะแนนรวมสูงกว่า ถูกกว่าต่องานที่ทำเสร็จ และเร็วกว่าต่องานเกินสองเท่า พาดหัวเรื่อง terminal-benchmark นั้นไม่ได้สร้างความแตกต่าง และไม่ควรใช้ตัดสินสิ่งใด
ถ้างานของคุณคือเอเจนต์ที่ต้องทำเวิร์กโฟลว์หลายขั้นตอนให้เสร็จโดยไม่มีผู้ดูแล GLM 5.3 Flash นำอยู่ 25 คะแนนบนเบนช์มาร์กที่ใช้ร่วมกันเพียงหนึ่งเดียวที่วัดเรื่องนี้โดยตรง และยังเป็นตัวที่ปรับแต่งได้ถูกกว่าของทั้งสอง เพราะคุณถือน้ำหนักโมเดลไว้ได้
การเสมอกันที่ 0.32828 เป็นภาพที่ถูกต้องสำหรับคู่นี้ แต่ไม่ใช่เพราะโมเดลทั้งสองเท่ากัน มันเป็นแถวเดียวที่โมเดลสองตัวซึ่งแทบไม่มีอะไรเหมือนกันเลยบังเอิญลงเอยที่ตัวเลขเดียวกัน — และการถือว่าตัวเลขนั้นเป็นบทสรุปของการเปรียบเทียบ คือวิธีที่การตัดสินใจจัดซื้อจัดจ้างถูกทำขึ้นจากตัวเลขที่ให้ข้อมูลน้อยที่สุดในตาราง
