การ์ดชื่อเรื่องหลักแบบฮีโร่สำหรับ GLM-5.2 vs Kimi K3 พร้อมคำโปรย 'ถูกกว่าและเร็วกว่า หรือใหญ่กว่าและดีกว่า' ป้ายทรงแคปซูลมนสามป้ายที่อ่านว่า 'บริบทโทเคน 1M ต่ออัน', 'AA Index 34 vs 44' และ '$1.40 / $4.40 vs $3.00 / $15.00' บรรทัดส่วนท้ายที่อ่านว่า 'การ์ดอัตราค่าบริการของผู้ให้บริการและ Artificial Analysis, 2026-09-23' และโลโก้ OrcaRouter ที่มุมขวาล่าง
Guides & Insights

GLM-5.2 vs Kimi K3: ถูกกว่าและเร็วกว่า หรือใหญ่กว่าและดีกว่า

ผู้เขียน

Alistair Wren

วันที่เผยแพร่

โมเดลล่าสุด · 20ดูโมเดลทั้งหมด
เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
กลับไปยังโพสต์ทั้งหมด

GLM-5.2 และ Kimi K3 เปิดตัวห่างกันหนึ่งเดือนในช่วงกลางปี 2026 และแทบจะกลับกันอย่างสมบูรณ์แบบ Kimi K3 ซึ่งเปิดตัวเมื่อ 2026-07-16 และเปิดน้ำหนักโมเดลตามมาในวันที่ 2026-07-27 เป็นโมเดลที่ใหญ่กว่า และเมื่อดูตามสเปกแล้วก็เป็นโมเดลที่ดีกว่า: 2.8 ล้านล้านพารามิเตอร์ โดยมี 104 พันล้านพารามิเตอร์ที่ใช้งานอยู่ และได้คะแนนสูงกว่าในแทบทุกเบนช์มาร์กที่ทั้งสองถูกนำไปทดสอบ GLM-5.2 เปิดตัวมาตั้งแต่ 2026-06-16 เป็นตัวที่เล็กกว่าในสองรุ่นนี้ด้วย 753 พันล้านพารามิเตอร์ โดยมี 40 พันล้านพารามิเตอร์ที่ใช้งานอยู่ และมีค่าใช้จ่ายต่อโทเคนเอาต์พุตประมาณหนึ่งในสาม ตอบได้เร็วกว่าเมื่อวัดที่ค่ามัธยฐาน และเผยแพร่ภายใต้ MIT แทนที่จะเป็นสัญญาอนุญาตเฉพาะที่อิงเงื่อนไขรายได้

นั่นคือการตัดสินใจในย่อหน้าเดียว สิ่งที่ตามมาคือหลักฐานที่รองรับการตัดสินใจนั้น — การคำนวณราคาของงานที่คุณอาจรันจริง การวัดผลในจุดที่ทั้งสองใกล้เคียงกันมากพอจนความแตกต่างเป็นเพียงสัญญาณรบกวน และตัวเลขยอดนิยมหนึ่งค่าที่ไม่สามารถเทียบได้กับตัวเลขที่พิมพ์อยู่ข้าง ๆ มัน

จุดยืนของทั้งสอง

ทั้งคู่พร้อมใช้งานโดยทั่วไปผ่าน API ของผู้จำหน่ายเอง ทั้งคู่สามารถกำหนดเส้นทางบน OrcaRouter ได้ และทั้งคู่มีน้ำหนักโมเดลที่ดาวน์โหลดได้ ความแตกต่างที่สำคัญก่อนที่คุณจะเข้าใกล้การเปรียบเทียบประสิทธิภาพ (benchmark) นั้นคือ:

• เปิดตัว — GLM-5.2 เมื่อ 2026-06-16 เทียบกับ Kimi K3 เมื่อ 2026-07-16 (หน้าโมเดลของ Artificial Analysis; หน้าโมเดลของ OrcaRouter เองสำหรับ Kimi K3 ระบุวันที่เร็วกว่าหนึ่งวัน คือ 2026-07-15)

• น้ำหนักโมเดล — GLM-5.2 เปิดให้ใช้ภายใต้สัญญาอนุญาต MIT เทียบกับ Kimi K3 ที่เปิดให้ใช้ภายใต้ Kimi K3 License ซึ่งกำหนดให้ต้องมีข้อตกลงแยกต่างหากเมื่อมีรายได้ประจำปีจาก model-as-a-service เกิน 20 ล้านดอลลาร์สหรัฐ และต้องระบุเครดิตอย่างชัดเจนเมื่อมีผู้ใช้รายเดือนเกิน 100 ล้านคน (การวิจัยและพัฒนาภายในได้รับการยกเว้น)

• ขนาด — GLM-5.2 753B รวม / 40B ที่ใช้งาน เทียบกับ Kimi K3 2.8T รวม / 104B ที่ใช้งาน

• บริบท — GLM-5.2 1,000,000 โทเค็น เทียบกับ Kimi K3 1,048,576 โทเค็น

• อินพุต — GLM-5.2 รับข้อความเข้า ส่งข้อความออก เทียบกับ Kimi K3 รับข้อความและรูปภาพเข้า ส่งข้อความออก

• จำนวนเอาต์พุตสูงสุดที่เผยแพร่ — GLM-5.2 128,000 โทเคน เทียบกับ Kimi K3 ที่ไม่เผยแพร่บนหน้า OrcaRouter

บน OrcaRouter ทั้งสองอยู่หลังคีย์เดียวบนเอนด์พอยต์ที่เข้ากันได้กับ OpenAI เพียงแห่งเดียวที่ https://api.orcarouter.ai/v1 และเราส่งราคาตามรายการของผู้ให้บริการผ่านไปตรง ๆ โดยไม่บวกมาร์กอัปเพิ่ม ดังนั้นทุกตัวเลขด้านล่างจึงเป็นตัวเลขของผู้ขาย ไม่ใช่ของเรา

ค่าใช้จ่ายของหนึ่งล้านโทเคน ในงานที่ต้องมีค่าใช้จ่าย

เรตการ์ดของผู้ให้บริการก่อน โดยอ่านจากหน้าข้อมูลราคาของผู้ให้บริการเองเมื่อวันที่ 2026-09-23 Z.ai ระบุราคา GLM-5.2 ไว้ที่ $1.40 ต่อหนึ่งล้านโทเคนอินพุต, $0.26 ต่อหนึ่งล้านโทเคนอินพุตที่แคชไว้ และ $4.40 ต่อหนึ่งล้านโทเคนเอาต์พุต. Moonshot ระบุราคา Kimi K3 ไว้ที่ $3.00 สำหรับอินพุต, $0.30 สำหรับการอ่านแคช, $15.00 สำหรับเอาต์พุต — บวกค่าธรรมเนียมการเขียนแคช $3.00 ต่อหนึ่งล้านสำหรับแคชห้านาที และ $6.00 ต่อหนึ่งล้านสำหรับแคชหนึ่งชั่วโมง ราคาเหล่านี้เป็นราคาที่ประกาศเผยแพร่ ไม่ใช่ราคาที่ผ่านการตรวจสอบอย่างอิสระ และผู้ให้บริการรายใดรายหนึ่งสามารถเปลี่ยนแปลงได้

ให้พวกมันทำงานที่เน้นการอ่านเป็นหลัก: การรีวิวโค้ดเบสขนาด 600,000 โทเคน พร้อมคำตอบเป็นลายลักษณ์อักษรขนาด 8,000 โทเคน บน GLM-5.2 นั่นคือ 0.6 x $1.40 = $0.84 สำหรับอินพุต บวก 0.008 x $4.40 = $0.035 สำหรับเอาต์พุต หรือประมาณ $0.88 บน Kimi K3 นั่นคือ 0.6 x $3.00 = $1.80 บวก 0.008 x $15.00 = $0.12 หรือประมาณ $1.92 คิดเป็นต้นทุนประมาณ 2.2 เท่าสำหรับงานเดียวกัน

ตอนนี้ลองรันอีกครั้งโดยที่โค้ดเบสอยู่ในแคชของผู้ให้บริการอยู่แล้ว บรรทัดอินพุตจะลดลงเหลืออัตราการอ่านแคช และราคาสองราคาที่เคยต่างกัน 2.1 เท่าก็กลายเป็น $0.26 เทียบกับ $0.30 ต่อล้าน — ช่องว่าง 15% นี่คือตัวเลขที่ถูกพูดถึงน้อยที่สุดในการเปรียบเทียบ และเป็นตัวเลขที่สำคัญที่สุดสำหรับเอเจนต์ที่อ่านบริบทเดิมซ้ำทุกเทิร์น มันยังมีเครื่องหมายดอกจันกำกับด้วย: Kimi K3 คิดค่าเขียนแคชแยกต่างหาก และหน้าเพจของ GLM-5.2 ไม่ได้แจ้งค่าธรรมเนียมการเขียนไว้เลย ดังนั้นการเริ่มแบบ cold start จึงมีค่าใช้จ่ายสูงกว่าที่ตัวเลขพาดหัว $3.00 บอกไว้อย่างมีนัยสำคัญเมื่อใช้ Kimi K3

• การอ่าน 600k โทเค็นพร้อมคำตอบ 8k — GLM-5.2 ประมาณ $0.88 เทียบกับ Kimi K3 ประมาณ $1.92

• บรรทัดอินพุตที่แคชไว้เดียวกัน — GLM-5.2 $0.16 เทียบกับ Kimi K3 $0.18 ต่อ 600k โทเค็น

A self-built two-column scoreboard for GLM-5.2 vs Kimi K3. Left column 'GLM-5.2' (753B total / 40B active, MIT, $1.40 / $4.40): Intelligence Index 34, blended price per million $0.902, cost per task $0.96, output speed 68.2 tok/s, long context AA-LCR 78%, agentic AutomationBench 28%. Right column 'Kimi K3' (2.8T total / 104B active, Kimi K3 License, $3.00 / $15.00): Intelligence Index 44, blended price per million $2.31, cost per task $2.00, output speed 36.7 tok/s, long context AA-LCR 89%, agentic AutomationBench 58%. Footer reads 'Benchmark, speed and cost figures per Artificial Analysis (Intelligence Index v4.3.2, read 2026-09-23), both models in their maximum-reasoning configuration. Vendor list prices per Z.ai and Moonshot. OrcaRouter passes provider list price through at 0% markup.'

โมเดลอิสระเห็นตรงกันในเรื่องทิศทาง แต่ไม่ตรงกันในเรื่องขนาด Artificial Analysis ผสมโทเคนแบบ cache-hit, อินพุต และเอาต์พุต ในอัตราส่วน 7:2:1 และบวกโทเคนการให้เหตุผลที่โมเดลใช้จริงเข้าไปด้วย และตัวเลขของมันสำหรับสองตัวนี้ — อ่านเมื่อ 2026-09-23 ภายใต้ดัชนี v4.3.2 ของมัน — ระบุว่า GLM-5.2 อยู่ที่ $0.902 ต่อล้านโทเคนผสม เทียบกับ $2.31 ของ Kimi K3 และต้นทุนในการทำภารกิจประเมินหนึ่งภารกิจให้เสร็จอยู่ที่ $0.96 เทียบกับ $2.00 การรัน Intelligence Index แบบเต็มหนึ่งครั้งมีค่าใช้จ่าย $1,559 บน GLM-5.2 และ $3,658 บน Kimi K3

มีรายละเอียดที่ขัดกับสัญชาตญาณซ่อนอยู่ในโมเดลต้นทุนนั้น Kimi K3 ใช้น้อยลงในจำนวนโทเคนเอาต์พุตต่องานเมื่อเทียบกับ GLM-5.2 — 48,000 เทียบกับ 64,000 — และโทเคนการให้เหตุผลน้อยกว่า 32,000 เทียบกับ 51,000 มันเป็นโมเดลที่ประหยัดกว่าต่อหน่วยงานและยังคงมีค่าใช้จ่ายต่องานประมาณสองเท่า เพราะราคาต่อโทเคนของมันอยู่ที่ 2.1 เท่าสำหรับอินพุตและ 3.4 เท่าสำหรับเอาต์พุต ความถูกต่องานกับความถูกต่อโทเคนเป็นคุณสมบัติที่แตกต่างกัน และนี่คือการจับคู่ที่ทั้งสองชี้ไปในทิศทางตรงกันข้าม

หน้าต่างบริบท และสิ่งที่ใส่ได้จริงในนั้น

ทั้งสองตัวต่างกันไม่ถึง 5% ตามตัวเลข: 1,000,000 โทเคน เทียบกับ 1,048,576 โทเคน การรายงานว่านี่เป็นชัยชนะของ Kimi K3 คงเป็นเรื่องเหลวไหล ทั้งคู่เป็นโมเดลระดับล้านโทเคน และหน้าต่างบริบทก็ไม่ใช่ปัจจัยที่ทำให้แตกต่าง คำถามที่ตรงไปตรงมาคือแต่ละตัวยังทำอะไรได้บ้างกับข้อความที่ถูกฝังอยู่ตรงกลางของมัน

นั่นคือสิ่งที่การประเมินการให้เหตุผลแบบบริบทยาวของ Artificial Analysis วัด และมันเป็นหนึ่งในช่องว่างที่กว้างกว่าของชุดข้อมูล: Kimi K3 ทำคะแนนได้ 89% เทียบกับ 78% ของ GLM-5.2 หากงานของคุณคือการโหลดคลังข้อความขนาดใหญ่แล้วถามคำถามที่ต้องเชื่อมโยงข้อเท็จจริงจากสองปลายที่อยู่ตรงข้ามกันของคลังนั้น โทเค็น 48,576 โทเค็นที่เพิ่มขึ้นมาไม่ใช่เหตุผลในการเลือก Kimi K3 — ความได้เปรียบด้านบริบทยาว 11 จุดต่างหากคือเหตุผล

พื้นใต้หน้าต่างก็แตกต่างกันเช่นกัน GLM-5.2 เผยแพร่เอาต์พุตสูงสุด 128,000 โทเคน ส่วนหน้าเพจของ Kimi K3 ไม่ได้เผยแพร่ตัวเลขที่เทียบเท่า ดังนั้นเราจะไม่ให้ตัวเลขนั้น หากคุณกำลังสร้างเอกสารยาวแทนที่จะอ่านมัน ความไม่สมมาตรนั้นควรนำไปเทียบกับปริมาณงานของคุณก่อนที่คุณจะซื้อตัวใดตัวหนึ่ง

ความเร็ว: แกนเดียวที่ GLM-5.2 ครองได้อย่างเบ็ดเสร็จ

การวัดที่เป็นอิสระต่อกันสองครั้งชี้ไปในทิศทางเดียวกันในกรณีนี้ ซึ่งนี่เป็นเรื่องที่ควรค่าแก่การกล่าวถึงก็เพราะว่าพวกมันไม่ได้เห็นพ้องตรงกันในทุกเรื่อง

ข้อมูลการจัดเส้นทางของเราเอง ในช่วงเจ็ดวันจนถึงวันที่ 2026-09-23 แสดงว่า GLM-5.2 ตอบด้วยค่ามัธยฐาน 3.28 วินาทีถึงโทเคนแรก เทียบกับ 8.09 วินาทีของ Kimi K3 และสตรีมมิ่งที่ 68.1 โทเคนต่อวินาที เทียบกับ 43.4 เวลาถึงโทเคนแรกที่ p95 ของทั้งสองโมเดลอยู่ที่ 10.00 วินาทีพอดี Artificial Analysis ซึ่งวัดแยกกัน พบว่า GLM-5.2 อยู่ที่ 68.2 โทเคนเอาต์พุตต่อวินาที เทียบกับ 36.7 ของ Kimi K3 ที่ 41.29 วินาทีแบบ end-to-end เทียบกับ 72.13 และที่ 33.95 วินาทีถึงคำตอบแรก เทียบกับ 58.52

A screenshot of the OrcaRouter model page for GLM 5.2 (z-ai/glm-5.2) captured 2026-09-23, showing the FEATURED badge, the byline 'by Z.ai · 2026-06-16', a 1M-token context with 128K maximum output and text in / text out, rate cards of $1.40 input and $4.40 output per 1M tokens with a $0.260 cache read, a p50 time to first token of 3.28 s against a p95 of 10.00 s, 29.4M tokens of traffic in the last 7 days, and a PERFORMANCE panel showing an output speed of 68.1 tokens per second and a 9.2% error rate.

สองแหล่งข้อมูลนี้แตกต่างกันในจุดหนึ่ง และควรค่าแก่การชี้ให้เห็นมากกว่าจะกลบเกลื่อนไป Artificial Analysis จัดให้ Kimi K3 อยู่ข้างหน้าเล็กน้อยในด้านเวลาถึงโทเคนแรกแบบดิบ โดยได้ 4.08 วินาที เทียบกับ 4.62 วินาที ขณะที่การกำหนดเส้นทางของเราเองทำให้ GLM-5.2 เร็วกว่าเกือบสองเท่าครึ่งที่ p50 ปลายทางต่างกัน ผู้ให้บริการต้นน้ำต่างกัน ช่วงเวลาต่างกัน ให้ถือว่าทิศทางด้านปริมาณงาน — GLM-5.2 เร็วกว่าอย่างสบาย ๆ — เป็นข้อมูลที่หนักแน่น และให้ถือว่าตัวเลขเวลาถึงโทเคนแรกค่าใดค่าเดียว ไม่ว่าจะเป็นของเราหรือของพวกเขา เป็นลักษณะเฉพาะของสัปดาห์ใดสัปดาห์หนึ่งโดยเฉพาะ

ยังมีตัวเลขอีกตัวบนหน้า GLM-5.2 ของเราที่เราจะไม่ปล่อยผ่านไปอย่างเงียบ ๆ: ในช่วงเจ็ดวันเดียวกัน มันแสดงอัตราข้อผิดพลาด 9.2% เทียบกับ 0.26% ของ Kimi K3 ช่องว่างขนาดนั้นมีโอกาสพอ ๆ กันที่จะเป็นสัปดาห์ที่แย่ของผู้ให้บริการต้นทางที่ให้บริการ GLM-5.2 กับที่จะเป็นคุณสมบัติของโมเดล และเจ็ดวันก็ไม่ใช่ช่วงเวลาที่นานพอจะแยกความแตกต่างได้ มันเป็นปัญหาชนิดที่ระบบ routing ถูกสร้างขึ้นมาเพื่อแก้ — เมื่อผู้ให้บริการมีคำขอที่ล้มเหลว 1 ใน 11 การ failover อัตโนมัติจะย้ายทราฟฟิกโดยไม่ต้องมีใครเพจเรียกทีม on-call

A screenshot of the OrcaRouter model page for Kimi K3 (kimi/kimi-k3) captured 2026-09-23, showing the FEATURED badge, the byline 'by MoonshotAI · 2026-07-15', text-and-image input with text output, a 1,048,576-token context, rate cards of $3.00 input and $15.00 output per 1M tokens with a $0.300 cache read, a p50 time to first token of 8.09 s against a p95 of 10.00 s, 1116.2M tokens of traffic in the last 7 days, and a PERFORMANCE panel showing an output speed of 43.4 tokens per second and a 0.26% error rate.

เบนช์มาร์ก: การทดสอบจริงที่ครอบคลุม แต่แคบกว่าที่พาดหัวไว้

Kimi K3 ชนะเกือบทุกอย่างที่ทั้งสองโมเดลถูกนำไปทดสอบ นี่คือตัวเลขของ Artificial Analysis ภายใต้การปรับปรุงดัชนี v4.3.2 โดยทั้งสองโมเดลอยู่ในคอนฟิกูเรชันการให้เหตุผลระดับสูงสุด อ่านเมื่อ 2026-09-23:

• Intelligence Index — Kimi K3 44 เทียบกับ GLM-5.2 34

• AA-Briefcase v1.1 — 1510 เทียบกับ 1233

• GDPval-AA v2.1 — 1524 กับ 1358

• AutomationBench-AA — 58% เทียบกับ 28%

• Terminal-Bench 4.0 — 13% เทียบกับ 1%

• SciCode — 59% เทียบกับ 51%

• ข้อสอบสุดท้ายของมนุษยชาติ — 47% กับ 41%

• GDP.pdf — 22% เทียบกับ 10%

• AA-LCR v1.1 — 89% เทียบกับ 78%

• CritPt — 23% เทียบกับ 21%

มีข้อควรระวังสองข้อก่อนที่ใครจะแคปหน้าจอรายการนั้น

อย่างแรก การปรับปรุงดัชนี การรายงานข่าวการเปิดตัว Kimi K3 ในเดือนกรกฎาคมอ้างคะแนนไว้ที่ 57 บน Intelligence Index โดย GLM-5.2 อยู่ที่ 51 ส่วนหน้าสดในวันนี้ระบุ 44 และ 34 นั่นไม่ใช่การวัดแบบเดียวกัน — Artificial Analysis ปรับปรุงดัชนีและให้คะแนนโมเดลใหม่เทียบกับดัชนีนั้น และการนำตัวเลขเดือนกรกฎาคมมาเทียบกับตัวเลขเดือนกันยายนเป็นความผิดพลาดที่เกิดขึ้นได้ง่ายที่สุดในการจับคู่นี้ ทิศทางคงที่ในทุก snapshot แต่ตัวเลขสัมบูรณ์ไม่สามารถเปรียบเทียบข้ามการปรับปรุงได้

ประการที่สอง ระดับต่างๆ Terminal-Bench 4.0 ที่ 13% และ 1% เป็นการประเมินที่โหด และที่ระดับสูงขนาดนั้น อัตราส่วนบอกอะไรได้มากกว่าตัวเลขใดตัวเลขหนึ่ง ส่วน AA-Omniscience ซึ่งทดสอบว่าโมเดลรู้ขีดจำกัดของความรู้ตัวเองหรือไม่ ให้ GLM-5.2 อยู่ที่ 4 เทียบกับ 20 ของ Kimi K3 — เป็นระดับต่ำสุดที่ควรรู้ไว้ หากคุณวางแผนจะรันตัวใดตัวหนึ่งแบบไม่มีผู้ดูแล

อีกสิ่งหนึ่งที่ Artificial Analysis บันทึกไว้เกี่ยวกับรายการ GLM-5.2 คือมันระบุว่าการกำหนดค่าการให้เหตุผลสูงสุด (maximum-reasoning configuration) เป็นเลิกใช้งานแล้ว โดยหันไปสนับสนุน GLM-5.3 ที่ใหม่กว่า สิ่งนี้ไม่ได้เปลี่ยนตัวเลขใด ๆ ข้างต้น ซึ่งเป็นสแนปช็อตของ GLM-5.2 ณ ขณะที่วัดค่าไว้ แต่มันหมายความว่าแผนงานของ Z.ai ได้ก้าวเลยโมเดลนี้ไปแล้ว บนเอนด์พอยต์แบบ routed การเปลี่ยนแปลงนี้มีต้นทุนเป็นเพียงสตริงชื่อโมเดลแทนที่จะเป็นการ migration ซึ่งเป็นเหตุผลหลักที่ว่าไม่ควรฮาร์ดโค้ดชื่อใดชื่อหนึ่งในสองชื่อนี้ลงในแอปพลิเคชันของคุณ

เอเจนต์และการใช้เครื่องมือ: จุดที่ช่องว่างกว้างที่สุด

หากบล็อกใดบล็อกหนึ่งในตารางนั้นควรเป็นตัวตัดสินการซื้อ ก็คือบล็อกนี้ งานแบบเอเจนต์ระยะยาวคือจุดที่ความได้เปรียบของ Kimi K3 มากที่สุดและสม่ำเสมอที่สุด:

• AutomationBench-AA — 58% เทียบกับ 28% ส่วนต่าง 30 จุด

• GDPval-AA v2.1 — 1524 กับ 1358

• AA-Briefcase v1.1 — 1510 เทียบกับ 1233

• Terminal-Bench 4.0 — 13% เทียบกับ 1%

เอกสารเปิดตัวของ Moonshot เองก็อาศัยเรื่องเล่าเดียวกัน — การเปิดตัวน้ำหนัก K3 มาพร้อมรายงานทางเทคนิคที่ครอบคลุมสแตกการฝึกแบบ expert-parallel ของผู้ขายและฮาร์เนสสภาพแวดล้อมสำหรับเอเจนต์ — แต่เอกสารของผู้ขายก็คือเอกสารของผู้ขาย และตัวเลขข้างต้นคือตัวเลขที่เป็นอิสระ

บริษัท第三方ผู้รวบรวมอย่าง LLM Stats ซึ่งคำนวณคอมโพสิตของตนเองบนชุดแบบทดสอบมาตรฐานที่ใช้ร่วมกัน ได้ข้อสรุปเดียวกันจากอีกทิศทางหนึ่ง: จากสิบเอ็ดแบบทดสอบที่มันให้คะแนนสำหรับทั้งสองโมเดล Kimi K3 ชนะทั้งสิบเอ็ด และคะแนนตามหมวดหมู่ของมันจัดให้ Kimi K3 นำในด้านการใช้เครื่องมือ (30.8 ต่อ 19.6) เอเจนต์ (38.3 ต่อ 29.6) และการเขียนโค้ด (42.3 ต่อ 34.8) นั่นเป็นคอมโพสิตของ LLM Stats เองภายใต้น้ำหนักของมันเอง บนชุดที่ใช้ร่วมกันซึ่งไม่ได้มีขนาดใหญ่ ดังนั้นควรถือเป็นหลักฐานสนับสนุนมากกว่าจะเป็นผลลัพธ์จากห้องแล็บ สิบเอ็ดจากสิบเอ็ดก็ยังไม่ถือว่าเป็นความต่างที่สูสี

การเขียนโค้ด

ทิศทางเดียวกัน แต่มาร์จิ้นเล็กกว่า ในการประเมินด้านการเขียนโค้ดที่ Artificial Analysis ให้คะแนนสำหรับทั้งสอง Kimi K3 นำใน SciCode 59% ต่อ 51% บนชุดที่แชร์ของ LLM Stats มันชนะ DeepSWE, DeepSWE 1.1, FrontierSWE, SWE-Marathon, Program Bench และ Terminal-Bench 2.1 ตัวเลขที่ดูดีของ GLM-5.2 — 99.2% บน AIME 2026, 94.4% บน HMMT 2025, 91.2% บน GPQA ตามที่ผู้รวบรวมบุคคลที่สามรายงาน — เป็นการรายงานโดยผู้ขายและยังไม่มีการทำซ้ำ และส่วนใหญ่เป็นการวัดคณิตศาสตร์แข่งขันมากกว่าวิศวกรรมซอฟต์แวร์

ข้อสรุปในทางปฏิบัติ: สำหรับเอเจนต์เขียนโค้ดที่ทำงานเป็นเวลานาน แก้ไขไฟล์จำนวนมาก และต้องกู้คืนจากข้อผิดพลาดของตัวเอง ความเหนือกว่าด้านความสามารถเชิงเอเจนต์ของ Kimi K3 ถือเป็นสัญญาณที่เกี่ยวข้องมากกว่าคะแนนคณิตศาสตร์ของโมเดลทั้งสอง สำหรับผู้ช่วยเขียนโค้ดที่เร็ว ราคาถูก และมักทำงานแบบครั้งเดียวจบ ข้อได้เปรียบด้านอัตราการประมวลผลของ GLM-5.2 คุ้มค่ามากกว่าต้นทุนจากช่องว่างของคะแนน benchmark

ในกรณีที่พวกมันใกล้กันมากพอจนไม่สำคัญ

• ราคาอินพุตที่แคชไว้ — $0.26 เทียบกับ $0.30 ต่อล้าน คิดเป็นส่วนต่าง 15% เทียบกับส่วนต่าง 3.4 เท่าในส่วนของเอาต์พุต

• หน้าต่างบริบท — 1,000,000 เทียบกับ 1,048,576 โทเค็น

• เวลาถึงโทเค็นแรกที่ p95 — 10.00 วินาที เทียบกับ 10.00 วินาทีบนระบบกำหนดเส้นทางของเราเอง

• CritPt — 23% เทียบกับ 21%

• คณิตศาสตร์ — LLM Stats จัดให้ GLM-5.2 อยู่นำเล็กน้อยในคะแนนรวมด้านคณิตศาสตร์ (41.4 เทียบกับ 40.9) ขณะที่ Kimi K3 นำในด้านคณิตศาสตร์ที่ใช้รูปภาพ จากหลักฐานที่มีอยู่ ไม่มีโมเดลใดครองความเป็นเลิศด้านเลขคณิต

ใครก็ตามที่บอกคุณว่าโมเดลเหล่านี้ตัวหนึ่งเป็นสองเท่าของอีกตัวในทุกด้าน กำลังอ่านตารางเพียงแถวเดียว

เลือก GLM-5.2 หาก…

คุณเป็นคนจ่ายบิล และบิลก็คือข้อจำกัด GLM-5.2 มีราคาเอาต์พุตประมาณหนึ่งในสาม ถูกกว่าในส่วนของแคชเช่นกัน ใช้สัญญาอนุญาต MIT โดยไม่มีเงื่อนไขรายได้ที่ต้องคอยตรวจสอบ เร็วกว่าเมื่อวัดที่ค่ามัธยฐาน และเร็วกว่ามากเมื่อสตรีม และหน้าต่างหนึ่งล้านโทเคนของมันก็ใกล้เคียงกับของ Kimi K3 มากพอที่ความต่างนั้นจะไม่ใช่ตัวตัดสินอะไรเลย ถ้าภาระงานของคุณคือข้อความเข้าและข้อความออก และส่วนใหญ่เป็นการอ่านมากกว่าการเรียกเครื่องมือเป็นสายยาว ๆ คะแนนแบบทดสอบที่มากกว่าของ Kimi K3 ก็เป็นคะแนนที่แอปพลิเคชันของคุณไม่มีวันเก็บได้

เลือก Kimi K3 ถ้า…

งานนี้เป็นงานแบบเอเจนต์และใช้เวลานาน ช่องว่าง 30 จุดบน AutomationBench, การนำบน GDPval และ AA-Briefcase, ส่วนต่างการให้เหตุผลบริบทยาว 11 จุด และการกวาดชุดร่วมของ LLM Stats ต่างชี้ไปทางเดียวกัน: Kimi K3 เป็นโมเดลที่ดีกว่าสำหรับการมอบหมายงานหลายขั้นตอนแล้วปล่อยทิ้งไว้ นอกจากนี้ยังเป็นเพียงหนึ่งเดียวในสองตัวที่รับภาพได้ คุณจะจ่ายแพงขึ้นประมาณสองเท่าต่องานสำหรับสิ่งนั้น และหากชุดงานที่คุณใช้ถูกแคชไว้หนัก ๆ คุณจะจ่ายน้อยกว่าสองเท่า — แต่เหตุผลที่ควรเลือกมันไม่ใช่ราคา และไม่ใช่ความเร็ว

ทั้งคู่สามารถกำหนดเส้นทางบน OrcaRouter ได้จากคีย์เดียว โดยใช้ปลายทางที่เข้ากันได้กับ OpenAI เพียงปลายทางเดียว ในราคาตามรายการของผู้ให้บริการ โดยไม่มีอะไรบวกเพิ่ม และทั้งคู่ทำงานอยู่ภายใต้ระบบ failover อัตโนมัติเดียวกัน นั่นคือวิธีที่ถูกที่สุดในการค้นหาว่าเวิร์กโหลดของคุณต้องการตัวไหนจริง ๆ เพราะการสลับระหว่างทั้งสองเป็นเพียงสตริงชื่อโมเดล ไม่ใช่สัญญา

การเปรียบเทียบในบทความนี้2

ตรวจพบจากบทความนี้ · เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน

© 2026 OrcaRouter

สำหรับผู้ให้บริการ

ให้บริการแพลตฟอร์มการอนุมานอยู่หรือไม่ นำโมเดลของคุณขึ้น OrcaRouter

providers@orcarouter.ai

เข้าร่วมคอมมูนิตี้ของเรา

Discordsupport@orcarouter.aiXGitHubYouTube