
GLM-5.2 vs Kimi K3: ถูกกว่าและเร็วกว่า หรือใหญ่กว่าและดีกว่า
- Orcaใหม่Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 ต่อ 1 ล้านโทเค็น
- orcaใหม่Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 ต่อ 1 ล้านโทเค็น
- deepseekใหม่DeepSeek: DeepSeek V4.1 Flash2026-09-1040ความฉลาด
- openaiOpenAI: GPT-6 Astra2026-09-0453ความฉลาด77การเขียนโค้ด
- googleGoogle: Gemini 3.8 Flash2026-09-0241ความฉลาด76การเขียนโค้ด
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245ความฉลาด76การเขียนโค้ด
- anthropicAnthropic: Claude Fable 5.12026-09-0153ความฉลาด82การเขียนโค้ด
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642ความฉลาด72การเขียนโค้ด
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 ต่อ 1 ล้านโทเค็น
- z-aiZ.ai: GLM 5.32026-08-1845ความฉลาด75การเขียนโค้ด
- obsidianQwen3.8 27B2026-08-1534ความฉลาด68การเขียนโค้ด
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236ความฉลาด69การเขียนโค้ด
- grokSpaceXAI: Grok 4.62026-08-1244ความฉลาด77การเขียนโค้ด
- metaMeta: Muse Spark 1.22026-08-0540ความฉลาด72การเขียนโค้ด
- qwenQwen: Qwen3.8 Max2026-08-0345ความฉลาด76การเขียนโค้ด
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134ความฉลาด69การเขียนโค้ด
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 ต่อ 1 ล้านโทเค็น
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
GLM-5.2 และ Kimi K3 เปิดตัวห่างกันหนึ่งเดือนในช่วงกลางปี 2026 และแทบจะกลับกันอย่างสมบูรณ์แบบ Kimi K3 ซึ่งเปิดตัวเมื่อ 2026-07-16 และเปิดน้ำหนักโมเดลตามมาในวันที่ 2026-07-27 เป็นโมเดลที่ใหญ่กว่า และเมื่อดูตามสเปกแล้วก็เป็นโมเดลที่ดีกว่า: 2.8 ล้านล้านพารามิเตอร์ โดยมี 104 พันล้านพารามิเตอร์ที่ใช้งานอยู่ และได้คะแนนสูงกว่าในแทบทุกเบนช์มาร์กที่ทั้งสองถูกนำไปทดสอบ GLM-5.2 เปิดตัวมาตั้งแต่ 2026-06-16 เป็นตัวที่เล็กกว่าในสองรุ่นนี้ด้วย 753 พันล้านพารามิเตอร์ โดยมี 40 พันล้านพารามิเตอร์ที่ใช้งานอยู่ และมีค่าใช้จ่ายต่อโทเคนเอาต์พุตประมาณหนึ่งในสาม ตอบได้เร็วกว่าเมื่อวัดที่ค่ามัธยฐาน และเผยแพร่ภายใต้ MIT แทนที่จะเป็นสัญญาอนุญาตเฉพาะที่อิงเงื่อนไขรายได้
นั่นคือการตัดสินใจในย่อหน้าเดียว สิ่งที่ตามมาคือหลักฐานที่รองรับการตัดสินใจนั้น — การคำนวณราคาของงานที่คุณอาจรันจริง การวัดผลในจุดที่ทั้งสองใกล้เคียงกันมากพอจนความแตกต่างเป็นเพียงสัญญาณรบกวน และตัวเลขยอดนิยมหนึ่งค่าที่ไม่สามารถเทียบได้กับตัวเลขที่พิมพ์อยู่ข้าง ๆ มัน
จุดยืนของทั้งสอง
ทั้งคู่พร้อมใช้งานโดยทั่วไปผ่าน API ของผู้จำหน่ายเอง ทั้งคู่สามารถกำหนดเส้นทางบน OrcaRouter ได้ และทั้งคู่มีน้ำหนักโมเดลที่ดาวน์โหลดได้ ความแตกต่างที่สำคัญก่อนที่คุณจะเข้าใกล้การเปรียบเทียบประสิทธิภาพ (benchmark) นั้นคือ:
• เปิดตัว — GLM-5.2 เมื่อ 2026-06-16 เทียบกับ Kimi K3 เมื่อ 2026-07-16 (หน้าโมเดลของ Artificial Analysis; หน้าโมเดลของ OrcaRouter เองสำหรับ Kimi K3 ระบุวันที่เร็วกว่าหนึ่งวัน คือ 2026-07-15)
• น้ำหนักโมเดล — GLM-5.2 เปิดให้ใช้ภายใต้สัญญาอนุญาต MIT เทียบกับ Kimi K3 ที่เปิดให้ใช้ภายใต้ Kimi K3 License ซึ่งกำหนดให้ต้องมีข้อตกลงแยกต่างหากเมื่อมีรายได้ประจำปีจาก model-as-a-service เกิน 20 ล้านดอลลาร์สหรัฐ และต้องระบุเครดิตอย่างชัดเจนเมื่อมีผู้ใช้รายเดือนเกิน 100 ล้านคน (การวิจัยและพัฒนาภายในได้รับการยกเว้น)
• ขนาด — GLM-5.2 753B รวม / 40B ที่ใช้งาน เทียบกับ Kimi K3 2.8T รวม / 104B ที่ใช้งาน
• บริบท — GLM-5.2 1,000,000 โทเค็น เทียบกับ Kimi K3 1,048,576 โทเค็น
• อินพุต — GLM-5.2 รับข้อความเข้า ส่งข้อความออก เทียบกับ Kimi K3 รับข้อความและรูปภาพเข้า ส่งข้อความออก
• จำนวนเอาต์พุตสูงสุดที่เผยแพร่ — GLM-5.2 128,000 โทเคน เทียบกับ Kimi K3 ที่ไม่เผยแพร่บนหน้า OrcaRouter
บน OrcaRouter ทั้งสองอยู่หลังคีย์เดียวบนเอนด์พอยต์ที่เข้ากันได้กับ OpenAI เพียงแห่งเดียวที่ https://api.orcarouter.ai/v1 และเราส่งราคาตามรายการของผู้ให้บริการผ่านไปตรง ๆ โดยไม่บวกมาร์กอัปเพิ่ม ดังนั้นทุกตัวเลขด้านล่างจึงเป็นตัวเลขของผู้ขาย ไม่ใช่ของเรา
ค่าใช้จ่ายของหนึ่งล้านโทเคน ในงานที่ต้องมีค่าใช้จ่าย
เรตการ์ดของผู้ให้บริการก่อน โดยอ่านจากหน้าข้อมูลราคาของผู้ให้บริการเองเมื่อวันที่ 2026-09-23 Z.ai ระบุราคา GLM-5.2 ไว้ที่ $1.40 ต่อหนึ่งล้านโทเคนอินพุต, $0.26 ต่อหนึ่งล้านโทเคนอินพุตที่แคชไว้ และ $4.40 ต่อหนึ่งล้านโทเคนเอาต์พุต. Moonshot ระบุราคา Kimi K3 ไว้ที่ $3.00 สำหรับอินพุต, $0.30 สำหรับการอ่านแคช, $15.00 สำหรับเอาต์พุต — บวกค่าธรรมเนียมการเขียนแคช $3.00 ต่อหนึ่งล้านสำหรับแคชห้านาที และ $6.00 ต่อหนึ่งล้านสำหรับแคชหนึ่งชั่วโมง ราคาเหล่านี้เป็นราคาที่ประกาศเผยแพร่ ไม่ใช่ราคาที่ผ่านการตรวจสอบอย่างอิสระ และผู้ให้บริการรายใดรายหนึ่งสามารถเปลี่ยนแปลงได้
ให้พวกมันทำงานที่เน้นการอ่านเป็นหลัก: การรีวิวโค้ดเบสขนาด 600,000 โทเคน พร้อมคำตอบเป็นลายลักษณ์อักษรขนาด 8,000 โทเคน บน GLM-5.2 นั่นคือ 0.6 x $1.40 = $0.84 สำหรับอินพุต บวก 0.008 x $4.40 = $0.035 สำหรับเอาต์พุต หรือประมาณ $0.88 บน Kimi K3 นั่นคือ 0.6 x $3.00 = $1.80 บวก 0.008 x $15.00 = $0.12 หรือประมาณ $1.92 คิดเป็นต้นทุนประมาณ 2.2 เท่าสำหรับงานเดียวกัน
ตอนนี้ลองรันอีกครั้งโดยที่โค้ดเบสอยู่ในแคชของผู้ให้บริการอยู่แล้ว บรรทัดอินพุตจะลดลงเหลืออัตราการอ่านแคช และราคาสองราคาที่เคยต่างกัน 2.1 เท่าก็กลายเป็น $0.26 เทียบกับ $0.30 ต่อล้าน — ช่องว่าง 15% นี่คือตัวเลขที่ถูกพูดถึงน้อยที่สุดในการเปรียบเทียบ และเป็นตัวเลขที่สำคัญที่สุดสำหรับเอเจนต์ที่อ่านบริบทเดิมซ้ำทุกเทิร์น มันยังมีเครื่องหมายดอกจันกำกับด้วย: Kimi K3 คิดค่าเขียนแคชแยกต่างหาก และหน้าเพจของ GLM-5.2 ไม่ได้แจ้งค่าธรรมเนียมการเขียนไว้เลย ดังนั้นการเริ่มแบบ cold start จึงมีค่าใช้จ่ายสูงกว่าที่ตัวเลขพาดหัว $3.00 บอกไว้อย่างมีนัยสำคัญเมื่อใช้ Kimi K3
• การอ่าน 600k โทเค็นพร้อมคำตอบ 8k — GLM-5.2 ประมาณ $0.88 เทียบกับ Kimi K3 ประมาณ $1.92
• บรรทัดอินพุตที่แคชไว้เดียวกัน — GLM-5.2 $0.16 เทียบกับ Kimi K3 $0.18 ต่อ 600k โทเค็น

โมเดลอิสระเห็นตรงกันในเรื่องทิศทาง แต่ไม่ตรงกันในเรื่องขนาด Artificial Analysis ผสมโทเคนแบบ cache-hit, อินพุต และเอาต์พุต ในอัตราส่วน 7:2:1 และบวกโทเคนการให้เหตุผลที่โมเดลใช้จริงเข้าไปด้วย และตัวเลขของมันสำหรับสองตัวนี้ — อ่านเมื่อ 2026-09-23 ภายใต้ดัชนี v4.3.2 ของมัน — ระบุว่า GLM-5.2 อยู่ที่ $0.902 ต่อล้านโทเคนผสม เทียบกับ $2.31 ของ Kimi K3 และต้นทุนในการทำภารกิจประเมินหนึ่งภารกิจให้เสร็จอยู่ที่ $0.96 เทียบกับ $2.00 การรัน Intelligence Index แบบเต็มหนึ่งครั้งมีค่าใช้จ่าย $1,559 บน GLM-5.2 และ $3,658 บน Kimi K3
มีรายละเอียดที่ขัดกับสัญชาตญาณซ่อนอยู่ในโมเดลต้นทุนนั้น Kimi K3 ใช้น้อยลงในจำนวนโทเคนเอาต์พุตต่องานเมื่อเทียบกับ GLM-5.2 — 48,000 เทียบกับ 64,000 — และโทเคนการให้เหตุผลน้อยกว่า 32,000 เทียบกับ 51,000 มันเป็นโมเดลที่ประหยัดกว่าต่อหน่วยงานและยังคงมีค่าใช้จ่ายต่องานประมาณสองเท่า เพราะราคาต่อโทเคนของมันอยู่ที่ 2.1 เท่าสำหรับอินพุตและ 3.4 เท่าสำหรับเอาต์พุต ความถูกต่องานกับความถูกต่อโทเคนเป็นคุณสมบัติที่แตกต่างกัน และนี่คือการจับคู่ที่ทั้งสองชี้ไปในทิศทางตรงกันข้าม
หน้าต่างบริบท และสิ่งที่ใส่ได้จริงในนั้น
ทั้งสองตัวต่างกันไม่ถึง 5% ตามตัวเลข: 1,000,000 โทเคน เทียบกับ 1,048,576 โทเคน การรายงานว่านี่เป็นชัยชนะของ Kimi K3 คงเป็นเรื่องเหลวไหล ทั้งคู่เป็นโมเดลระดับล้านโทเคน และหน้าต่างบริบทก็ไม่ใช่ปัจจัยที่ทำให้แตกต่าง คำถามที่ตรงไปตรงมาคือแต่ละตัวยังทำอะไรได้บ้างกับข้อความที่ถูกฝังอยู่ตรงกลางของมัน
นั่นคือสิ่งที่การประเมินการให้เหตุผลแบบบริบทยาวของ Artificial Analysis วัด และมันเป็นหนึ่งในช่องว่างที่กว้างกว่าของชุดข้อมูล: Kimi K3 ทำคะแนนได้ 89% เทียบกับ 78% ของ GLM-5.2 หากงานของคุณคือการโหลดคลังข้อความขนาดใหญ่แล้วถามคำถามที่ต้องเชื่อมโยงข้อเท็จจริงจากสองปลายที่อยู่ตรงข้ามกันของคลังนั้น โทเค็น 48,576 โทเค็นที่เพิ่มขึ้นมาไม่ใช่เหตุผลในการเลือก Kimi K3 — ความได้เปรียบด้านบริบทยาว 11 จุดต่างหากคือเหตุผล
พื้นใต้หน้าต่างก็แตกต่างกันเช่นกัน GLM-5.2 เผยแพร่เอาต์พุตสูงสุด 128,000 โทเคน ส่วนหน้าเพจของ Kimi K3 ไม่ได้เผยแพร่ตัวเลขที่เทียบเท่า ดังนั้นเราจะไม่ให้ตัวเลขนั้น หากคุณกำลังสร้างเอกสารยาวแทนที่จะอ่านมัน ความไม่สมมาตรนั้นควรนำไปเทียบกับปริมาณงานของคุณก่อนที่คุณจะซื้อตัวใดตัวหนึ่ง
ความเร็ว: แกนเดียวที่ GLM-5.2 ครองได้อย่างเบ็ดเสร็จ
การวัดที่เป็นอิสระต่อกันสองครั้งชี้ไปในทิศทางเดียวกันในกรณีนี้ ซึ่งนี่เป็นเรื่องที่ควรค่าแก่การกล่าวถึงก็เพราะว่าพวกมันไม่ได้เห็นพ้องตรงกันในทุกเรื่อง
ข้อมูลการจัดเส้นทางของเราเอง ในช่วงเจ็ดวันจนถึงวันที่ 2026-09-23 แสดงว่า GLM-5.2 ตอบด้วยค่ามัธยฐาน 3.28 วินาทีถึงโทเคนแรก เทียบกับ 8.09 วินาทีของ Kimi K3 และสตรีมมิ่งที่ 68.1 โทเคนต่อวินาที เทียบกับ 43.4 เวลาถึงโทเคนแรกที่ p95 ของทั้งสองโมเดลอยู่ที่ 10.00 วินาทีพอดี Artificial Analysis ซึ่งวัดแยกกัน พบว่า GLM-5.2 อยู่ที่ 68.2 โทเคนเอาต์พุตต่อวินาที เทียบกับ 36.7 ของ Kimi K3 ที่ 41.29 วินาทีแบบ end-to-end เทียบกับ 72.13 และที่ 33.95 วินาทีถึงคำตอบแรก เทียบกับ 58.52

สองแหล่งข้อมูลนี้แตกต่างกันในจุดหนึ่ง และควรค่าแก่การชี้ให้เห็นมากกว่าจะกลบเกลื่อนไป Artificial Analysis จัดให้ Kimi K3 อยู่ข้างหน้าเล็กน้อยในด้านเวลาถึงโทเคนแรกแบบดิบ โดยได้ 4.08 วินาที เทียบกับ 4.62 วินาที ขณะที่การกำหนดเส้นทางของเราเองทำให้ GLM-5.2 เร็วกว่าเกือบสองเท่าครึ่งที่ p50 ปลายทางต่างกัน ผู้ให้บริการต้นน้ำต่างกัน ช่วงเวลาต่างกัน ให้ถือว่าทิศทางด้านปริมาณงาน — GLM-5.2 เร็วกว่าอย่างสบาย ๆ — เป็นข้อมูลที่หนักแน่น และให้ถือว่าตัวเลขเวลาถึงโทเคนแรกค่าใดค่าเดียว ไม่ว่าจะเป็นของเราหรือของพวกเขา เป็นลักษณะเฉพาะของสัปดาห์ใดสัปดาห์หนึ่งโดยเฉพาะ
ยังมีตัวเลขอีกตัวบนหน้า GLM-5.2 ของเราที่เราจะไม่ปล่อยผ่านไปอย่างเงียบ ๆ: ในช่วงเจ็ดวันเดียวกัน มันแสดงอัตราข้อผิดพลาด 9.2% เทียบกับ 0.26% ของ Kimi K3 ช่องว่างขนาดนั้นมีโอกาสพอ ๆ กันที่จะเป็นสัปดาห์ที่แย่ของผู้ให้บริการต้นทางที่ให้บริการ GLM-5.2 กับที่จะเป็นคุณสมบัติของโมเดล และเจ็ดวันก็ไม่ใช่ช่วงเวลาที่นานพอจะแยกความแตกต่างได้ มันเป็นปัญหาชนิดที่ระบบ routing ถูกสร้างขึ้นมาเพื่อแก้ — เมื่อผู้ให้บริการมีคำขอที่ล้มเหลว 1 ใน 11 การ failover อัตโนมัติจะย้ายทราฟฟิกโดยไม่ต้องมีใครเพจเรียกทีม on-call

เบนช์มาร์ก: การทดสอบจริงที่ครอบคลุม แต่แคบกว่าที่พาดหัวไว้
Kimi K3 ชนะเกือบทุกอย่างที่ทั้งสองโมเดลถูกนำไปทดสอบ นี่คือตัวเลขของ Artificial Analysis ภายใต้การปรับปรุงดัชนี v4.3.2 โดยทั้งสองโมเดลอยู่ในคอนฟิกูเรชันการให้เหตุผลระดับสูงสุด อ่านเมื่อ 2026-09-23:
• Intelligence Index — Kimi K3 44 เทียบกับ GLM-5.2 34
• AA-Briefcase v1.1 — 1510 เทียบกับ 1233
• GDPval-AA v2.1 — 1524 กับ 1358
• AutomationBench-AA — 58% เทียบกับ 28%
• Terminal-Bench 4.0 — 13% เทียบกับ 1%
• SciCode — 59% เทียบกับ 51%
• ข้อสอบสุดท้ายของมนุษยชาติ — 47% กับ 41%
• GDP.pdf — 22% เทียบกับ 10%
• AA-LCR v1.1 — 89% เทียบกับ 78%
• CritPt — 23% เทียบกับ 21%
มีข้อควรระวังสองข้อก่อนที่ใครจะแคปหน้าจอรายการนั้น
อย่างแรก การปรับปรุงดัชนี การรายงานข่าวการเปิดตัว Kimi K3 ในเดือนกรกฎาคมอ้างคะแนนไว้ที่ 57 บน Intelligence Index โดย GLM-5.2 อยู่ที่ 51 ส่วนหน้าสดในวันนี้ระบุ 44 และ 34 นั่นไม่ใช่การวัดแบบเดียวกัน — Artificial Analysis ปรับปรุงดัชนีและให้คะแนนโมเดลใหม่เทียบกับดัชนีนั้น และการนำตัวเลขเดือนกรกฎาคมมาเทียบกับตัวเลขเดือนกันยายนเป็นความผิดพลาดที่เกิดขึ้นได้ง่ายที่สุดในการจับคู่นี้ ทิศทางคงที่ในทุก snapshot แต่ตัวเลขสัมบูรณ์ไม่สามารถเปรียบเทียบข้ามการปรับปรุงได้
ประการที่สอง ระดับต่างๆ Terminal-Bench 4.0 ที่ 13% และ 1% เป็นการประเมินที่โหด และที่ระดับสูงขนาดนั้น อัตราส่วนบอกอะไรได้มากกว่าตัวเลขใดตัวเลขหนึ่ง ส่วน AA-Omniscience ซึ่งทดสอบว่าโมเดลรู้ขีดจำกัดของความรู้ตัวเองหรือไม่ ให้ GLM-5.2 อยู่ที่ 4 เทียบกับ 20 ของ Kimi K3 — เป็นระดับต่ำสุดที่ควรรู้ไว้ หากคุณวางแผนจะรันตัวใดตัวหนึ่งแบบไม่มีผู้ดูแล
อีกสิ่งหนึ่งที่ Artificial Analysis บันทึกไว้เกี่ยวกับรายการ GLM-5.2 คือมันระบุว่าการกำหนดค่าการให้เหตุผลสูงสุด (maximum-reasoning configuration) เป็นเลิกใช้งานแล้ว โดยหันไปสนับสนุน GLM-5.3 ที่ใหม่กว่า สิ่งนี้ไม่ได้เปลี่ยนตัวเลขใด ๆ ข้างต้น ซึ่งเป็นสแนปช็อตของ GLM-5.2 ณ ขณะที่วัดค่าไว้ แต่มันหมายความว่าแผนงานของ Z.ai ได้ก้าวเลยโมเดลนี้ไปแล้ว บนเอนด์พอยต์แบบ routed การเปลี่ยนแปลงนี้มีต้นทุนเป็นเพียงสตริงชื่อโมเดลแทนที่จะเป็นการ migration ซึ่งเป็นเหตุผลหลักที่ว่าไม่ควรฮาร์ดโค้ดชื่อใดชื่อหนึ่งในสองชื่อนี้ลงในแอปพลิเคชันของคุณ
เอเจนต์และการใช้เครื่องมือ: จุดที่ช่องว่างกว้างที่สุด
หากบล็อกใดบล็อกหนึ่งในตารางนั้นควรเป็นตัวตัดสินการซื้อ ก็คือบล็อกนี้ งานแบบเอเจนต์ระยะยาวคือจุดที่ความได้เปรียบของ Kimi K3 มากที่สุดและสม่ำเสมอที่สุด:
• AutomationBench-AA — 58% เทียบกับ 28% ส่วนต่าง 30 จุด
• GDPval-AA v2.1 — 1524 กับ 1358
• AA-Briefcase v1.1 — 1510 เทียบกับ 1233
• Terminal-Bench 4.0 — 13% เทียบกับ 1%
เอกสารเปิดตัวของ Moonshot เองก็อาศัยเรื่องเล่าเดียวกัน — การเปิดตัวน้ำหนัก K3 มาพร้อมรายงานทางเทคนิคที่ครอบคลุมสแตกการฝึกแบบ expert-parallel ของผู้ขายและฮาร์เนสสภาพแวดล้อมสำหรับเอเจนต์ — แต่เอกสารของผู้ขายก็คือเอกสารของผู้ขาย และตัวเลขข้างต้นคือตัวเลขที่เป็นอิสระ
บริษัท第三方ผู้รวบรวมอย่าง LLM Stats ซึ่งคำนวณคอมโพสิตของตนเองบนชุดแบบทดสอบมาตรฐานที่ใช้ร่วมกัน ได้ข้อสรุปเดียวกันจากอีกทิศทางหนึ่ง: จากสิบเอ็ดแบบทดสอบที่มันให้คะแนนสำหรับทั้งสองโมเดล Kimi K3 ชนะทั้งสิบเอ็ด และคะแนนตามหมวดหมู่ของมันจัดให้ Kimi K3 นำในด้านการใช้เครื่องมือ (30.8 ต่อ 19.6) เอเจนต์ (38.3 ต่อ 29.6) และการเขียนโค้ด (42.3 ต่อ 34.8) นั่นเป็นคอมโพสิตของ LLM Stats เองภายใต้น้ำหนักของมันเอง บนชุดที่ใช้ร่วมกันซึ่งไม่ได้มีขนาดใหญ่ ดังนั้นควรถือเป็นหลักฐานสนับสนุนมากกว่าจะเป็นผลลัพธ์จากห้องแล็บ สิบเอ็ดจากสิบเอ็ดก็ยังไม่ถือว่าเป็นความต่างที่สูสี
การเขียนโค้ด
ทิศทางเดียวกัน แต่มาร์จิ้นเล็กกว่า ในการประเมินด้านการเขียนโค้ดที่ Artificial Analysis ให้คะแนนสำหรับทั้งสอง Kimi K3 นำใน SciCode 59% ต่อ 51% บนชุดที่แชร์ของ LLM Stats มันชนะ DeepSWE, DeepSWE 1.1, FrontierSWE, SWE-Marathon, Program Bench และ Terminal-Bench 2.1 ตัวเลขที่ดูดีของ GLM-5.2 — 99.2% บน AIME 2026, 94.4% บน HMMT 2025, 91.2% บน GPQA ตามที่ผู้รวบรวมบุคคลที่สามรายงาน — เป็นการรายงานโดยผู้ขายและยังไม่มีการทำซ้ำ และส่วนใหญ่เป็นการวัดคณิตศาสตร์แข่งขันมากกว่าวิศวกรรมซอฟต์แวร์
ข้อสรุปในทางปฏิบัติ: สำหรับเอเจนต์เขียนโค้ดที่ทำงานเป็นเวลานาน แก้ไขไฟล์จำนวนมาก และต้องกู้คืนจากข้อผิดพลาดของตัวเอง ความเหนือกว่าด้านความสามารถเชิงเอเจนต์ของ Kimi K3 ถือเป็นสัญญาณที่เกี่ยวข้องมากกว่าคะแนนคณิตศาสตร์ของโมเดลทั้งสอง สำหรับผู้ช่วยเขียนโค้ดที่เร็ว ราคาถูก และมักทำงานแบบครั้งเดียวจบ ข้อได้เปรียบด้านอัตราการประมวลผลของ GLM-5.2 คุ้มค่ามากกว่าต้นทุนจากช่องว่างของคะแนน benchmark
ในกรณีที่พวกมันใกล้กันมากพอจนไม่สำคัญ
• ราคาอินพุตที่แคชไว้ — $0.26 เทียบกับ $0.30 ต่อล้าน คิดเป็นส่วนต่าง 15% เทียบกับส่วนต่าง 3.4 เท่าในส่วนของเอาต์พุต
• หน้าต่างบริบท — 1,000,000 เทียบกับ 1,048,576 โทเค็น
• เวลาถึงโทเค็นแรกที่ p95 — 10.00 วินาที เทียบกับ 10.00 วินาทีบนระบบกำหนดเส้นทางของเราเอง
• CritPt — 23% เทียบกับ 21%
• คณิตศาสตร์ — LLM Stats จัดให้ GLM-5.2 อยู่นำเล็กน้อยในคะแนนรวมด้านคณิตศาสตร์ (41.4 เทียบกับ 40.9) ขณะที่ Kimi K3 นำในด้านคณิตศาสตร์ที่ใช้รูปภาพ จากหลักฐานที่มีอยู่ ไม่มีโมเดลใดครองความเป็นเลิศด้านเลขคณิต
ใครก็ตามที่บอกคุณว่าโมเดลเหล่านี้ตัวหนึ่งเป็นสองเท่าของอีกตัวในทุกด้าน กำลังอ่านตารางเพียงแถวเดียว
เลือก GLM-5.2 หาก…
คุณเป็นคนจ่ายบิล และบิลก็คือข้อจำกัด GLM-5.2 มีราคาเอาต์พุตประมาณหนึ่งในสาม ถูกกว่าในส่วนของแคชเช่นกัน ใช้สัญญาอนุญาต MIT โดยไม่มีเงื่อนไขรายได้ที่ต้องคอยตรวจสอบ เร็วกว่าเมื่อวัดที่ค่ามัธยฐาน และเร็วกว่ามากเมื่อสตรีม และหน้าต่างหนึ่งล้านโทเคนของมันก็ใกล้เคียงกับของ Kimi K3 มากพอที่ความต่างนั้นจะไม่ใช่ตัวตัดสินอะไรเลย ถ้าภาระงานของคุณคือข้อความเข้าและข้อความออก และส่วนใหญ่เป็นการอ่านมากกว่าการเรียกเครื่องมือเป็นสายยาว ๆ คะแนนแบบทดสอบที่มากกว่าของ Kimi K3 ก็เป็นคะแนนที่แอปพลิเคชันของคุณไม่มีวันเก็บได้
เลือก Kimi K3 ถ้า…
งานนี้เป็นงานแบบเอเจนต์และใช้เวลานาน ช่องว่าง 30 จุดบน AutomationBench, การนำบน GDPval และ AA-Briefcase, ส่วนต่างการให้เหตุผลบริบทยาว 11 จุด และการกวาดชุดร่วมของ LLM Stats ต่างชี้ไปทางเดียวกัน: Kimi K3 เป็นโมเดลที่ดีกว่าสำหรับการมอบหมายงานหลายขั้นตอนแล้วปล่อยทิ้งไว้ นอกจากนี้ยังเป็นเพียงหนึ่งเดียวในสองตัวที่รับภาพได้ คุณจะจ่ายแพงขึ้นประมาณสองเท่าต่องานสำหรับสิ่งนั้น และหากชุดงานที่คุณใช้ถูกแคชไว้หนัก ๆ คุณจะจ่ายน้อยกว่าสองเท่า — แต่เหตุผลที่ควรเลือกมันไม่ใช่ราคา และไม่ใช่ความเร็ว
ทั้งคู่สามารถกำหนดเส้นทางบน OrcaRouter ได้จากคีย์เดียว โดยใช้ปลายทางที่เข้ากันได้กับ OpenAI เพียงปลายทางเดียว ในราคาตามรายการของผู้ให้บริการ โดยไม่มีอะไรบวกเพิ่ม และทั้งคู่ทำงานอยู่ภายใต้ระบบ failover อัตโนมัติเดียวกัน นั่นคือวิธีที่ถูกที่สุดในการค้นหาว่าเวิร์กโหลดของคุณต้องการตัวไหนจริง ๆ เพราะการสลับระหว่างทั้งสองเป็นเพียงสตริงชื่อโมเดล ไม่ใช่สัญญา
การเปรียบเทียบในบทความนี้2
ตรวจพบจากบทความนี้ · เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
