
GPT-6.1 Sol vs GLM-5.3: น้ำหนักโมเดลถูกปล่อยแล้ว และบิลก็ไม่ขยับ
- openaiใหม่OpenAI: GPT-6.1 Sol2026-09-2952ความฉลาด
- anthropicใหม่Anthropic: Claude Sonnet 5.52026-09-2856ความฉลาด
- typesafeใหม่TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 ต่อ 1 ล้านโทเค็น · 161 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238ความฉลาด
- OpenAIOpenAI: GPT-6 Sol2026-09-2248ความฉลาด
- AnthropicAnthropic: Claude Opus 5.52026-09-2258ความฉลาด
- xAIGrok 4.72026-09-2146ความฉลาด
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 ต่อ 1 ล้านโทเค็น · 79 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 ต่อ 1 ล้านโทเค็น · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040ความฉลาด
- OpenAIOpenAI: GPT-6 Astra2026-09-0453ความฉลาด77การเขียนโค้ด
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241ความฉลาด76การเขียนโค้ด
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245ความฉลาด76การเขียนโค้ด
- AnthropicAnthropic: Claude Fable 5.12026-09-0153ความฉลาด82การเขียนโค้ด
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 ต่อ 1 ล้านโทเค็น · 53 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น · 301 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642ความฉลาด72การเขียนโค้ด
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 ต่อ 1 ล้านโทเค็น · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845ความฉลาด75การเขียนโค้ด
- obsidianQwen3.8 27B2026-08-1534ความฉลาด68การเขียนโค้ด
OpenAI เปิดตัว GPT-6.1 Sol เมื่อวันที่ 29 กันยายน 2026 ในงานคีย์โน้ต DevDay ของบริษัท และ Z.ai เปิดตัว GLM-5.3 ก่อนหน้านั้นหกสัปดาห์ เมื่อวันที่ 18 สิงหาคม 2026 จากนั้นเก็บเช็กพอยต์ไว้หนึ่งสัปดาห์ การเก็บไว้ครั้งนั้นจบลงแล้ว: zai-org/GLM-5.3 อยู่บน Hugging Face ตั้งแต่วันที่ 25 สิงหาคม เป็นเช็กพอยต์ BF16/FP8 ที่มีพารามิเตอร์ราว 753 พันล้านตัว โดยประมาณ 40 พันล้านตัวทำงานต่อโทเคน และนับตั้งแต่นั้นมียอดดาวน์โหลดเกิน 1.4 ล้านครั้งแล้ว ดังนั้นคำถามที่การเปรียบเทียบส่วนใหญ่ถามมาตั้งแต่เดือนสิงหาคม — นี่คือโมเดลแบบเปิดหรือแบบเช่า? — มีคำตอบแล้ว และคำตอบนั้นไม่ได้เปลี่ยนสมการ บนบอร์ดอิสระ GPT-6.1 Sol ได้คะแนน 51.8 และมีค่าใช้จ่าย $0.72 ต่องาน Index ที่ทำเสร็จหนึ่งงาน; GLM-5.3 ได้คะแนน 44.8 และมีค่าใช้จ่าย $2.01 ตอนนี้คุณเป็นเจ้าของโมเดลที่ถูกกว่าต่อโทเคนได้แล้ว แต่ยังจ่ายแพงกว่าเกือบสามเท่าต่องานที่ทำเสร็จหนึ่งงาน
แต่ละโมเดลจริงๆ แล้วคืออะไร
GPT-6.1 Sol เป็นโมเดล GPT-6 ระดับกลางของ OpenAI อยู่ต่ำกว่าเรือธง GPT-6 Astra หนึ่งขั้น และอยู่เหนือ GPT-6 Luna ระดับประหยัด โดยมีหน้าต่างบริบท 1,050,000 โทเคน เพดานเอาต์พุต 128,000 โทเคน และจุดตัดความรู้วันที่ 30 เมษายน 2026 และรับข้อความ รูปภาพ และไฟล์เป็นอินพุต การให้เหตุผลทำงานตั้งแต่low ถึง max โดยค่าเริ่มต้นเป็น medium; none และ minimal ค่า ที่ GPT-6 Sol ยอมรับ ตอนนี้ส่งคืนข้อผิดพลาด ซึ่งคำแนะนำการย้ายข้อมูลของ OpenAI เองจัดการโดยบอกนักพัฒนาให้แทนที่ด้วย low ค่าใช้จ่ายอยู่ที่ $2.00 ต่อล้านโทเคนอินพุต และ $10.00 ต่อล้านเอาต์พุต โดยอินพุตแคชอยู่ที่ $0.10
GLM-5.3 เป็นเรือธงรุ่นปัจจุบันของ Z.ai สำหรับงานวิศวกรรมซอฟต์แวร์และงานเอเจนต์ระยะยาว สร้างบนฐาน mixture-of-experts เดียวกับ GLM-5.2 โดยความสามารถที่เพิ่มขึ้นมาจาก post-training มากกว่ามาจากโมเดลที่ใหญ่ขึ้น เป็นแบบ text-in, text-out — ไม่มี vision ไม่ว่าราคาใดก็ตาม — พร้อมหน้าต่าง 1M โทเคน เพดานเอาต์พุต 128,000 โทเคน และเปิดโหมด thinking ไว้ตลอด ไม่มีโหมด non-reasoning ซึ่งเป็นข้อจำกัดตายตัวสำหรับการเรียกที่ไวต่อความหน่วง Z.ai ตั้งราคาไว้ที่ $1.40 ขาเข้า และ $4.40 ขาออก ต่อล้านโทเคน โดยอินพุตที่แคชไว้อยู่ที่ $0.26 ส่วนแคตตาล็อกของเราเองลงไว้ที่ $1.26 และ $3.96 พร้อมการอ่านจากแคชที่ $0.234 ดังนั้นการ์ดราคาของผู้ขายจึงเป็นตัวเลขที่อนุรักษ์นิยมกว่า และเป็นตัวเลขที่ควรใช้ในการถกเถียง
เรทการ์ด และบรรทัดที่กลับด้านมัน
หนึ่งบรรทัดต่อมิติ โดยเปิดทั้งสองด้านในแต่ละบรรทัด:
• อินพุต — GPT-6.1 Sol $2.00 ต่อ 1M เทียบกับ GLM-5.3 $1.40 ต่อ 1M; GLM ถูกกว่า 30%
• เอาต์พุต — GPT-6.1 Sol $10.00 ต่อ 1M เทียบกับ GLM-5.3 $4.40 ต่อ 1M; GLM ถูกกว่า 56%
• อินพุตแคช — GPT-6.1 Sol $0.10 ต่อ 1M เทียบกับ GLM-5.3 $0.26 ต่อ 1M; ลำดับพลิกกลับ Sol ถูกกว่า 2.6×
• เงื่อนไขบริบทยาว — GPT-6.1 Sol คิดราคาคำขอทั้งหมดใหม่เมื่ออินพุตโทเค็นเกิน 272,000 โดยคิดอินพุตและแคชเป็น 2× และเอาต์พุตเป็น 1.5× เทียบกับ GLM-5.3 ที่ไม่มีข้อกำหนดเทียบเท่าบนการ์ดที่เผยแพร่
• บริบทและเอาต์พุต — 1,050,000 อินพุต / 128,000 เอาต์พุต เทียบกับ 1M อินพุต / 128,000 เอาต์พุต; ต่างกัน 5% ซึ่งไม่มีนัยสำคัญ
• รูปแบบข้อมูล — รับข้อความ รูปภาพ และไฟล์เข้า ส่งข้อความออก เทียบกับข้อความเท่านั้น
• ระดับการให้เหตุผลขั้นต่ำ — GPT-6.1 Sol: ต่ำ, กลาง (ค่าเริ่มต้น), สูง, xhigh, สูงสุด เทียบกับ GLM-5.3: เปิดตลอดเวลา ไม่มีระดับขั้นต่ำให้ลดลงไป
• น้ำหนักโมเดล — ปิด ผ่าน API เท่านั้น เทียบกับเปิด ดาวน์โหลดได้ FP8
• คะแนนอิสระ Artificial Analysis v4.3.2 ที่ความพยายามสูงสุด — 51.8 เทียบกับ 44.8
• ต้นทุนอิสระต่องานดัชนี — $0.72 เทียบกับ $2.01
• โทเค็นเอาต์พุตสำหรับการรันดัชนี — 67 ล้าน เทียบกับ 210 ล้าน
<img src="2.3 Sol vs GLM-5.3" alt="กระดานคะแนนเปรียบเทียบสองคอลัมน์ที่สร้างขึ้น หัวข้อ 'GPT-6.1 Sol vs GLM-5.3 the scoreboard' คอลัมน์ซ้าย 'GPT-6.1 Sol': แถวที่ระบุว่า 'Intelligence Index: 51.8', 'Cost per index task: $0.72', 'Input price: $2.00 per 1M', 'Output price: $10.00 per 1M', 'Output tokens on index run: 67M', 'Weights: closed' คอลัมน์ขวา 'GLM-5.3': แถวที่ระบุว่า 'Intelligence Index: 44.8', 'Cost per index task: $2.01', 'Input price: $1.40 per 1M', 'Output price: $4.40 per 1M', 'Output tokens on index run: 210M', 'Weights: open on Hugging Face' ส่วนท้ายระบุว่า 'Independent figures per Artificial Analysis v4.3.2 at max effort; vendor list prices' โลโก้ OrcaRouter อยู่ที่มุมขวาล่าง" /> คู่สุดท้ายนี่แหละคือจุดที่การแข่งขันครั้งนี้ตัดสิน และมันไม่ใช่ผลเพียงเล็กน้อยเลย

ปัญหา 210 ล้านโทเคน
Artificial Analysis ใช้ชุดการประเมินเดียวกันจำนวนสิบรายการกับทุกโมเดลบนบอร์ด และเผยแพร่จำนวนโทเคนที่อยู่เบื้องหลังแต่ละคะแนน GLM-5.3 สร้างโทเคนเอาต์พุตประมาณ 210 ล้านโทเคนในการทำรันให้เสร็จ GPT-6.1 Sol สร้าง 67 ล้าน เมื่อเทียบกับกลุ่มเปรียบเทียบของโมเดลแต่ละตัวบนบอร์ด 210 ล้านของ GLM-5.3 อยู่เหนือค่ามัธยฐานของกลุ่มที่ประมาณ 140 ล้าน ขณะที่ 67 ล้านของ Sol อยู่ต่ำกว่าค่ามัธยฐานประมาณ 81 ล้านของกลุ่มเรือธงที่มันถูกให้คะแนนอยู่พอสมควร เนื่องจากเอาต์พุตเป็นฝั่งที่มีค่าใช้จ่ายสูงของอัตราค่าบริการทุกรายการ ส่วนลด 56% ที่โฆษณาไว้ในรายการเอาต์พุตของ GLM-5.3 จึงไม่รอดเมื่อเจอการวัดจริง: มันปล่อยโทเคน 3.1 เท่า ในราคา 0.44 เท่า และ 3.1 × 0.44 เท่ากับ 1.37 — GLM-5.3 เป็นโมเดลที่แพงกว่าบนภาระงานนี้แม้ว่าอัตราค่าบริการจะถูกกว่าอย่างมีนัยสำคัญ
ตัวเลขต้นทุนต่องานของบอร์ดเองยืนยันทั้งทิศทางและขนาดโดยคร่าว ๆ $2.01 เทียบกับ $0.72 เท่ากับ 2.8× ซึ่งกว้างกว่าที่อัตราส่วนโทเคนเพียงอย่างเดียวบ่งชี้ เพราะ GLM-5.3 ยังมีค่าใช้จ่ายสูงกว่าในรายการอินพุตและแคชต่อหนึ่งงาน ควรพูดให้ชัดเจนว่าสิ่งนี้พิสูจน์และไม่ได้พิสูจน์อะไร: การรันดัชนีคือการประเมินแบบคงที่สิบครั้ง และความเยิ่นเย้อในการประเมินเหล่านั้นไม่ได้เหมือนกับความเยิ่นเย้อในทราฟฟิกของคุณ แต่สำหรับผู้ซื้อ โทเคนคือสิ่งที่ถูกเรียกเก็บเงิน และลักษณะของความแตกต่างก็เหมือนกันในชุดงานใด ๆ ที่โมเดลต้องสร้างคำตอบยาว
ส่วนหักลบเพียงบางส่วนคือบรรทัดอินพุตที่แคชไว้ การอ่านแคชของ GLM-5.3 อยู่ที่ $0.26 เทียบกับฐาน $1.40 และของ GPT-6.1 Sol อยู่ที่ $0.10 เทียบกับฐาน $2.00 — Sol ชนะด้วยอัตราส่วน 2.6 เท่าในอัตราที่ครอบงำงานใด ๆ ที่มีคำนำหน้าแบบคงที่ หากทราฟฟิกของคุณเป็นคลังข้อมูลคงที่ขนาดใหญ่ที่ให้คำตอบเพียงหนึ่งย่อหน้า GLM-5.3 ก็เป็นตัวเลือกที่ถูกกว่าอย่างชัดเจน และคุณควรเลือกใช้มัน หากทราฟฟิกของคุณมีลักษณะเหมือนทราฟฟิกที่ทั้งสองโมเดลนี้ถูกสร้างขึ้นมาเพื่อรองรับ — ลูปของเอเจนต์ การแก้ไขในระดับทั้งรีโป เอาต์พุตที่สร้างขึ้นยาว ๆ — ข้อได้เปรียบของอินพุตที่แคชไว้จะหดเล็กลงจนกลายเป็นเพียงสัญญาณรบกวนเมื่อเทียบกับอัตราส่วนโทเค็นที่ต่างกัน 3 เท่า
ตัวเลขของผู้ขายไปอยู่ตรงไหน
ตัวเลขเปิดตัวของ Z.ai นั้นแข็งแกร่ง และเช่นเคย ยังไม่มีใครทำซ้ำได้ Terminal-Bench 2.1 อยู่ที่ 88.2, DeepSWE v1.1 อยู่ที่ 66.9, CyberGym อยู่ที่ 84.5, ExploitBench อยู่ที่ 54.4, AutomationBench อยู่ที่ 48.2, GDPval-AA v2 อยู่ที่ 1769 Elo ตัวเลขหนึ่งที่ควรอ่านสองครั้งคือ Terminal-Bench 3.0 ที่ 28.3 — เป็นเบนช์มาร์กรุ่นสืบทอด และเป็นการแก้ไขตัวเลข 88.2 บนรุ่นเก่า โมเดลหนึ่งตัวอาจยอดเยี่ยมบนเบนช์มาร์กที่การฝึกหลังการฝึก (post-training) ของมันมุ่งเป้าไว้ และธรรมดาบนเบนช์มาร์กรุ่นถัดไปของเบนช์มาร์กเดียวกัน
ตัวเลขการเปิดตัวของ OpenAI สำหรับ GPT-6.1 Sol ถูกวางกรอบไว้ทั้งหมดที่ต้นทุนต่องานที่ทำเสร็จ แทนที่จะเป็นคะแนนดิบ: DeepSWE v1.1 เอาชนะคะแนนดีที่สุดของ GPT-6 Sol ได้ 6.4 จุดเปอร์เซ็นต์ ด้วยความพยายามในการให้เหตุผลที่ต่ำกว่า, AutomationBench 1.0.6 อยู่เหนือ Claude Opus 5.5 2.2 จุด ที่ความพยายามระดับกลาง, OSWorld 2.0 เพิ่มขึ้นเจ็ดจุดจาก GPT-6 Sol ที่ความพยายามสูงสุด, Terminal-Bench Science 0.1 มากกว่าสองเท่าของ GPT-6 Sol ด้วยต้นทุนต่องานที่ต่ำกว่าครึ่งหนึ่ง โปรดทราบว่าสิ่งเหล่านี้เป็น ของ OpenAI ฮาร์เนสที่ การตั้งค่าของ OpenAI บน ชุดเกณฑ์มาตรฐานที่เลือกโดย OpenAI และไม่มีอันใดเลยที่ได้รับการทำซ้ำอย่างอิสระ
ความทับซ้อนระหว่างชุดผลลัพธ์ที่เผยแพร่ของผู้ให้บริการทั้งสองมีน้อย และการเปรียบเทียบโดยตรงเพียงหนึ่งเดียวที่มีอยู่ก็อยู่บนเบนช์มาร์กเดียวกัน: Z.ai รายงานค่า 66.9 บน DeepSWE v1.1 ส่วน OpenAI รายงานค่า 68.8 สำหรับ GPT-6 Sol — โมเดลที่ 6.1 เข้ามาแทน — และรายงานการปรับปรุง 6.4 จุดของ 6.1 Sol เมื่อเทียบกับรุ่นก่อนหน้าของตัวเอง ห่างกันสองจุดในการเปรียบเทียบที่ผู้ให้บริการรายงาน และห่างกันราวหกจุดในส่วนต่างที่ OpenAI รายงานเอง นั่นใกล้เคียงกับการเปรียบเทียบแบบควบคุม และสอดคล้องกับสิ่งที่คณะกรรมการอิสระกล่าวไว้: ความสามารถใกล้เคียงกันมาก แต่ช่องว่างกว้างในเรื่องต้นทุนของการทำงานให้เสร็จ
API หนึ่งตัว หรือสองสัญญา
ทั้งสองโมเดลอยู่บน OrcaRouter ซึ่งเป็นส่วนที่ผิดปกติของการจับคู่นี้ GPT-6.1 Sol เข้าสู่แคตตาล็อกในราคาตามรายการของ OpenAI เองตอนเปิดตัว — $2.00 และ $10.00 ต่อล้านโทเค็น อินพุตแบบแคช $0.10 โดยมีขั้นที่ 272,000 โทเค็นเป็น $4.00 และ $15.00 ส่งผ่านมาตรงตามที่ผู้ขายระบุไว้ทุกประการ — และ GLM-5.3 อยู่เคียงข้างกันที่ $1.26 และ $3.96 พร้อมการอ่านแคช $0.234 ไม่มีการบวกเพิ่มใด ๆ ทั้งสิ้น: แพลตฟอร์มส่งผ่านราคาตามรายการของผู้ให้บริการโดยไม่เปลี่ยนแปลง ซึ่งเป็นเหตุผลว่าทำไมการลดราคาของผู้ขายจึงปรากฏทางฝั่งเราในวันเดียวกัน แทนที่จะเป็นหลังตัวแทนจำหน่ายเจรจาใหม่

เรื่องนี้สำคัญกับคู่นี้โดยเฉพาะมากกว่าคู่อื่นๆ การเลือกระหว่างสองตัวนี้ไม่ใช่คำถามว่า "ตัวไหนดีกว่า" — แต่เป็นเส้นแบ่งที่อิงกับความยาวเอาต์พุตของคุณเอง และเส้นแบ่งนี้จะขยับครั้งแรกที่ Z.ai ปรับเรตการ์ดให้คมขึ้น หรือ OpenAI เปลี่ยนขอบเขตเทียร์ของเทียร์ 6.1 การเก็บทั้งสองไว้หลังคีย์เดียว พร้อมการ failover อัตโนมัติระหว่างกัน และกฎการกำหนดเส้นทางที่คุณแก้ในคอนฟิกแทนที่จะแก้ในดีพลอย คือสิ่งที่ทำให้คุณทดสอบเส้นแบ่งนั้นกับทราฟฟิกจริงได้ แทนที่จะเถียงกันเรื่องนี้ หากแคชไลน์ของ Sol ชนะเวิร์กโหลดของคุณ ก็ให้กำหนดเส้นทางไปที่มัน; ถ้าความยาวคำตอบของคุณยังสั้น และการ์ดแบบคงที่ของ GLM-5.3 ที่ไม่มีหน้าผาบริบทชนะในเซกเมนต์นั้น ก็ให้กำหนดเส้นทางไปที่ตัวนั้นแทน — คีย์เดียวกัน ไม่มีสัญญาที่สอง ไม่มีบิลใบที่สอง

อันไหน ถ้าคุณต้องเลือกวันนี้
• เอาต์พุตที่สร้างยาว ๆ ลูปแบบเอเจนต์ งานที่เน้นเอาต์พุตจำนวนมาก — GPT-6.1 Sol และส่วนต่างใกล้เคียงสามเท่าเมื่อนำจำนวนโทเคนมาคิด นี่คือจุดที่ตารางราคาโกหก แต่การวัดไม่โกหก
• พรีฟิกซ์ที่เสถียร คำตอบสั้น — GLM-5.3 อัตราอินพุตและอินพุตที่แคชไว้ดีกว่าจริง ๆ และความเยิ่นเย้อก็ไม่มีโอกาสกัดกิน
• คำขอใดก็ตามที่อินพุตเกิน 272,000 โทเคน — GLM-5.3 เพราะ GPT-6.1 Sol คิดราคาคำขอทั้งหมดใหม่ที่ขอบเขตนั้น และตารางราคาของ GLM-5.3 ไม่มีขั้นบันไดแบบนั้น
• อะไรก็ตามที่มีภาพหรือเอกสารเป็นอินพุตเชิงภาพ — GPT-6.1 Sol เพราะ GLM-5.3 รองรับข้อความเท่านั้น และนี่ไม่ได้ใกล้เคียงกันเลย
• การประมวลผลภายในขอบเขตของคุณเอง หรือการป้องกันความเสี่ยงหากเงื่อนไขของผู้ให้บริการเปลี่ยนไป — GLM-5.3 และตอนนี้มีให้ดาวน์โหลดจริงแล้ว ไม่ใช่แค่สัญญาว่าจะมี เตรียมงบสำหรับฮาร์ดแวร์ไว้ด้วย เพราะเช็กพอยต์นี้เป็นไฟล์ FP8 ขนาดใหญ่ และการโฮสต์เองเป็นการตัดสินใจด้านทุน ไม่ใช่เรื่อง API
• การเรียกที่ไวต่อความหน่วง — ไม่มีตัวไหนเลยถ้าไม่ระวัง GLM-5.3 ไม่มีวิธีปิดการคิดวิเคราะห์ ส่วน GPT-6.1 Sol มีพื้นอยู่ที่ ต่ำ และเวลาถึงโทเคนแรกของมันบนบอร์ดอิสระวัดได้ 332 วินาที เทียบกับค่ามัธยฐานของบอร์ดที่ 3.7
การเปรียบเทียบในบทความนี้3
ตรวจพบจากบทความนี้ · เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
