
Claude Opus 5.5 กับ Grok 4.6: โมเดลหนึ่งอ่าน อีกโมเดลหนึ่งลงมือทำ
- openaiใหม่OpenAI: GPT-6.1 Sol2026-09-2952ความฉลาด
- anthropicใหม่Anthropic: Claude Sonnet 5.52026-09-2856ความฉลาด
- typesafeใหม่TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 ต่อ 1 ล้านโทเค็น · 221 tok/s
- OpenAIใหม่OpenAI: GPT-6 Luna2026-09-2238ความฉลาด
- OpenAIใหม่OpenAI: GPT-6 Sol2026-09-2248ความฉลาด
- Anthropicใหม่Anthropic: Claude Opus 5.52026-09-2258ความฉลาด
- xAIใหม่Grok 4.72026-09-2146ความฉลาด
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 ต่อ 1 ล้านโทเค็น · 106 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 ต่อ 1 ล้านโทเค็น · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040ความฉลาด
- OpenAIOpenAI: GPT-6 Astra2026-09-0453ความฉลาด77การเขียนโค้ด
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241ความฉลาด76การเขียนโค้ด
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245ความฉลาด76การเขียนโค้ด
- AnthropicAnthropic: Claude Fable 5.12026-09-0153ความฉลาด82การเขียนโค้ด
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 ต่อ 1 ล้านโทเค็น · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น · 104 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642ความฉลาด72การเขียนโค้ด
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 ต่อ 1 ล้านโทเค็น · 214 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845ความฉลาด75การเขียนโค้ด
- obsidianQwen3.8 27B2026-08-1534ความฉลาด68การเขียนโค้ด
Claude Opus 5.5 และ Grok 4.6 เป็นสองวิธีที่ถูกที่สุดในการซื้อโมเดลระดับแนวหน้าที่รองรับบริบทได้ครึ่งล้านโทเคน — และทั้งสองไม่ใช่ผลิตภัณฑ์เดียวกัน ในการวัดค่าหนึ่ง Grok 4.6 ห่างจากเพดานสูงสุดเพียงสามจุด: 94.9 บน GPQA Diamond ชุดคำถามวิทยาศาสตร์ระดับบัณฑิตศึกษาที่เรือธงของ Anthropic อยู่ในช่วงเดียวกัน ในการวัดถัดไป มันตามหลังอยู่สามสิบแปดจุด บน Terminal-Bench 4.0 ซึ่งเป็นเบนช์มาร์กเทอร์มินัลแบบเอเจนต์ที่ให้โมเดลทำงานจริงในเชลล์ Artificial Analysis ให้คะแนน Grok 4.6 ที่ 21.21% และ Claude Opus 5.5 ที่ 59.60% นั่นไม่ใช่การพิมพ์ผิดในทิศทางใดทิศทางหนึ่ง และรูปทรงทั้งหมดของการจับคู่นี้อยู่ที่การอธิบายว่าทำไมตัวเลขทั้งสองจึงเป็นจริงพร้อมกัน
สองการเปิดตัว ราคาระดับเดียวกัน ห่างกันสี่เดือน
SpaceXAI เปิดตัว Grok 4.6 เมื่อวันที่ 12 สิงหาคม 2026 ในฐานะเรือธงปัจจุบันของสาย Grok ในราคา $2.00 ต่อล้านโทเค็นอินพุตและ $6.00 เอาต์พุต พร้อมหน้าต่างบริบท 500,000 โทเค็น และพื้นผิวอินพุตแบบข้อความ รูปภาพ และไฟล์ Anthropic เปิดตัว Claude Opus 5.5 เมื่อวันที่ 22 กันยายน 2026 ประมาณหกสัปดาห์ต่อมา ในราคา $4.00/$20.00 พร้อมหน้าต่างบริบท 1,000,000 โทเค็นและโทเค็นเอาต์พุต 128,000 ทั้งสองรองรับความพยายามในการให้เหตุผลที่กำหนดค่าได้ การเรียกใช้เครื่องมือ และเอาต์พุตแบบมีโครงสร้าง ทั้งคู่พูดพื้นผิวแชทที่เข้ากันได้กับ OpenAI รวมถึงรูปแบบเฉพาะของผู้จำหน่ายเอง
ดังนั้นการอ่านแบบผิวเผินจึงเป็นการแลกเปลี่ยนที่ชัดเจน: Grok 4.6 มีราคาต่ออินพุตครึ่งหนึ่ง และประมาณหนึ่งในสามสำหรับเอาต์พุต ส่วน Claude Opus 5.5 ตอบด้วยหน้าต่างบริบทเป็นสองเท่า การแลกเปลี่ยนนี้เป็นของจริง และในงานเอกสารยาว มันอาจเป็นสิ่งเดียวที่สำคัญ มันยังไม่ใช่จุดที่ความแตกต่างที่น่าสนใจอยู่ เพราะทั้งสองโมเดลถูกวัดบนชุดทดสอบอิสระเดียวกัน และไม่ได้ลงเอยที่ตำแหน่งเดียวกันบนแกนที่สำคัญสำหรับงานแบบเอเจนต์
สิ่งที่แค็ตตาล็อกระบุไว้บนแกนที่ทั้งคู่ถูกวัด
แค็ตตาล็อกของ OrcaRouter มีที่มาของผลการวัดประสิทธิภาพกำกับในแต่ละแถว — ตัวเลขแต่ละตัวระบุชื่อผู้ประเมินที่มันมาจาก — ดังนั้นคู่ด้านล่างจึงมาจากแหล่งเดียวกันทั้งสองโมเดล คือ Artificial Analysis แทนที่จะเป็นตัวเลขจากผู้ขายในด้านหนึ่งและจากบุคคลที่สามในอีกด้านหนึ่ง:
• GPQA Diamond — Claude Opus 5.5 ไม่ได้ระบุในแกนนี้ในแค็ตตาล็อกของเรา; Grok 4.6 ได้คะแนน 94.9%
• Humanity's Last Exam — Claude Opus 5.5 ทำได้ 61.4% เทียบกับ Grok 4.6 ที่ 42.9%
• SciCode — 66.9% เทียบกับ 56.5%
• การเรียกคืนบริบทแบบยาว — 84.7% เทียบกับ 80.3%
• Terminal-Bench 4.0 — 59.60% เทียบกับ 21.21%
• AA Intelligence Index — 57.6 เทียบกับ 44.3
แถว GPQA ถูกเว้นว่างไว้โดยเจตนาในฝั่งของ Anthropic แทนที่จะเติมจากสไลด์ของผู้ขาย คะแนน 94.9 ของ Grok 4.6 ในแถวนั้นเป็นตัวเลขที่แข็งแรงที่สุดบนการ์ดของมัน และมันเป็นของจริง — เป็นการวัดโดยอิสระ ไม่ใช่คำกล่าวอ้างของ SpaceXAI — และมันบ่งบอกสิ่งที่เป็นจริงเกี่ยวกับโมเดลนี้ว่า เมื่องานเป็นคำถามที่ตั้งไว้อย่างเรียบร้อยและมีคำตอบที่ปกป้องได้เพียงหนึ่งเดียว Grok 4.6 ก็ทำงานได้ในระดับแนวหน้า เมื่ออ่านคู่กับ 21.21% ของ Terminal-Bench 4.0 รูปร่างก็เริ่มชัดเจนขึ้น การสร้างคำตอบที่ถูกต้องเกี่ยวกับวิทยาศาสตร์ กับการลงมือทำงานห้าขั้นตอนในเชลล์กับระบบไฟล์จริง เป็นความสามารถคนละอย่างกัน และ Grok 4.6 ไปได้ไกลกว่ามากในอย่างแรกเมื่อเทียบกับอย่างหลัง
ข้อควรระวังหนึ่งประการเกี่ยวกับการจับคู่นั้นก่อนที่มันจะถูกใช้เป็นคำตัดสิน: ตัวเลขจาก Artificial Analysis ของทั้งสองโมเดลถูกบันทึก ณ วันที่ประเมินที่ต่างกัน โดยของ Grok 4.6 เป็นชุดที่เก่ากว่า การเปรียบเทียบนี้เป็นการเทียบระหว่างโมเดลที่ประเมินในเดือนสิงหาคมกับโมเดลที่ประเมินในเดือนกันยายน บนชุดทดสอบที่ตัวมันเองได้รับการปรับปรุงตลอดช่วงเวลาดังกล่าว ทิศทางของช่องว่างสอดคล้องกันในห้าแกนที่แยกจากกัน ซึ่งเป็นเหตุผลที่เราถือว่ามันเป็นสัญญาณ แต่ค่าคะแนนที่แน่นอนควรอ่านเป็นการเปรียบเทียบสิงหาคมเทียบกับกันยายน ไม่ใช่การเปรียบเทียบในวันเดียวกัน
ดัชนีที่สร้างขึ้นโดยคนที่ไม่ได้ขายอะไรเช่นกัน
มีมาตรวัดอิสระตัวที่สอง และมันสอดคล้องกันในแง่ทิศทาง ขณะเดียวกันก็ยอมแยกแยะความแตกต่างแบบละเอียดน้อยกว่ามาก ดัชนีขีดความสามารถ Epoch (Epoch Capabilities Index) ซึ่งสร้างโดย Epoch AI โดยเป็นองค์ประกอบรวมจากการทดสอบกว่า 50 รายการ และปรับสเกลใหม่ให้ Claude 3.5 Sonnet อยู่ที่ 130 และ GPT-5 อยู่ที่ 150 จัดให้ Claude Opus 5.5 อยู่ที่ 167.35 ในไฟล์ที่เราอ่านเมื่อวันที่ 2 ตุลาคม 2026 ส่วน Grok 4.6 อยู่ที่ 156.61 จากการประเมินเมื่อวันที่ 12 สิงหาคม นั่นคือช่องว่าง 10.74 จุดบนสเกลที่พบว่า ประมาณห้าจุดสอดคล้องกับการเพิ่มขึ้นเป็นสองเท่าของมาตรวัดขอบเขตเวลาของ METR ณ เวลาที่เปิดตัวดัชนี ซึ่งกว้าง และอยู่นอกช่วงที่เผยแพร่ของทั้งสองโมเดลอย่างสบาย ๆ คือ 164.0 ถึง 172.0 และ 154.66 ถึง 158.93 โดยช่วงเหล่านี้ไม่ทับซ้อนกันเลย
น่าสังเกตว่าดัชนีนี้ไม่ได้ตัดสินอะไร ดัชนีนี้จัดให้ Claude Sonnet 5.5 อยู่ที่ 165.2 และ Claude Fable 5.1 อยู่ที่ 164.82 ซึ่งทั้งคู่อยู่เหนือ Grok 4.6 และทั้งสองรุ่นมีราคาต่อโทเคนเอาต์พุตหนึ่งล้านโทเคนถูกกว่าอัตราระดับที่สองของ Grok 4.6 ใครก็ตามที่เลือกโดยดูจากความสามารถต่อราคาเพียงอย่างเดียวก็ยังมีตัวเลือกที่สามและสี่ในตระกูลผู้ขายเดียวกัน ส่วนการจับคู่ในบทความนี้เป็นเรื่องอื่น นั่นคือแต่ละรุ่นในสองรุ่นนี้เก่งเรื่องอะไร
การ์ดราคา และแถวที่ปรากฏเฉพาะบนหนึ่งในนั้น

เรตการ์ดของ Grok 4.6 มีขั้นบันไดที่เรตการ์ดของ Claude Opus 5.5 ไม่มี: คำขอที่มีโทเคนพรอมป์ต์เกิน 200,000 จะคิดค่าบริการเป็นสองเท่าของอัตราฐาน ดังนั้นอินพุตจะเพิ่มจาก $2.00 เป็น $4.00 และเอาต์พุตจาก $6.00 เป็น $12.00 โดยการอ่านแคชขยับจาก $0.50 เป็น $1.00 Claude Opus 5.5 คิด $4.00/$20.00 โดยการอ่านแคชอยู่ที่ $0.20 คงที่ตลอดหน้าต่าง 1,000,000 โทเคนทั้งหมด การกลับทิศนี้เป็นผลในทางปฏิบัติของการซื้อบริบทแบบยาวจากโมเดลใดก็ตาม และมันพลิกการเปรียบเทียบราคาหน้าป้ายเมื่อภาระงานเติบโตขึ้นจริง:
• ราคาที่ 30,000 โทเค็นอินพุต — Claude Opus 5.5 เป็นรุ่นที่แพง โดยอยู่ที่ประมาณ 28 เซนต์สำหรับอินพุต 30,000 และเอาต์พุต 8,000 เทียบกับประมาณ 11 เซนต์สำหรับ Grok 4.6
• ราคาที่ 250,000 โทเคนอินพุต — ลำดับกลับกัน เพราะ Grok 4.6 ได้ขยับไปยังระดับที่เพิ่มเป็นสองเท่าของมันแล้ว ในขณะที่ Claude Opus 5.5 ยังไม่ได้
• การอ่านแคช — $0.20 ต่อล้านสำหรับ Claude Opus 5.5 เทียบกับ $0.50 ซึ่งเพิ่มขึ้นเป็น $1.00 เมื่อเกินขั้น สำหรับ Grok 4.6
• เอาต์พุตสูงสุด — 128,000 โทเคนสำหรับ Claude Opus 5.5; เพดานเอาต์พุตของ Grok 4.6 ไม่ได้เผยแพร่ไว้ในบันทึกแคตตาล็อก
Grok 4.6 ยังมีช่องว่างหนึ่งจุดที่ควรกล่าวอย่างตรงไปตรงมา แทนที่จะปล่อยให้ไปค้นพบในภายหลัง บันทึกของมันไม่ระบุตัวเลขเอาต์พุตสูงสุดเลย — ฟิลด์นี้ยังไม่ได้วัด ไม่ใช่ศูนย์ — ดังนั้นงานที่ต้องอาศัยคำตอบเดียวยาวมากจึงไม่มีตัวเลขที่เผยแพร่ให้ใช้วางแผนเทียบได้ในฝั่งนั้นของการเปรียบเทียบ
คอลัมน์ประสิทธิภาพที่ไม่ควรอ่าน
แค็ตตาล็อกของเรายังมีแผงประสิทธิภาพการให้บริการต่อโมเดล และบน Grok 4.6 มันเป็นสิ่งที่ทำให้เข้าใจผิดมากที่สุดบนหน้านี้ การ์ดระบุค่าแลเทนซี p50 ที่ 10,000 มิลลิวินาที และอัตราข้อผิดพลาด 97.58% ในช่วงเวลาเจ็ดวัน โดยมีโทเค็นที่ให้บริการ 26,184 โทเค็นในช่วงเวลานั้น ฟิลด์เหล่านี้ไม่ได้อธิบายถึงโมเดลที่ช้า แต่พวกมันอธิบายถึงโมเดลที่แทบไม่ถูกเรียกใช้เลย: ที่ระดับทราฟฟิกนั้น ตัวอย่างบางเกินไปจนการกระจายตัวของแลเทนซีไม่มีความหมายอะไร และอัตราข้อผิดพลาดสะท้อนถึงความพยายามเพียงไม่กี่ครั้งมากกว่าที่จะเป็นคุณภาพการให้บริการ การถือเอาบล็อกนั้นเป็นหลักฐานว่า Grok 4.6 ช้า ก็เท่ากับการอ่านอาร์ติแฟกต์จากการวัดเป็นผลการวัด
ในทางกลับกัน แผงของ Claude Opus 5.5 นั้นมีประชากรอยู่เบื้องหลัง — ค่า p50 อยู่ในช่วง 4.4 วินาที ในหน้าต่างเวลาเจ็ดวันโดยมีการสุ่มตัวอย่างรายวัน และมีโทเคนที่ให้บริการไป 156 ล้านโทเคนในช่วงเดียวกัน แม้แต่ตัวเลขนั้นก็ควรถูกอ่านตามที่มันเป็นจริง นั่นคือ ทราฟฟิก playground ของเราเอง ซึ่งเป็นตัวอย่างของผู้ใช้ของเรา ไม่ใช่คุณสมบัติของโมเดล
จะเลือกส่งอันไหน และจะหาคำตอบได้อย่างไรจากงานของคุณเอง
ความแตกต่างที่ตัวเลขเหล่านี้อธิบายนั้นมีเสถียรภาพมากพอที่จะนำไปใช้ตัดสินใจได้ Claude Opus 5.5 เป็นตัวเลือกสำหรับงานแบบเอเจนต์และงานระยะยาว — ช่องว่างใน Terminal-Bench 4.0 ที่ 59.60% เทียบกับ 21.21% เป็นความแตกต่างที่มากที่สุดในแกนใด ๆ ที่ทั้งสองโมเดลถูกวัด และเป็นแกนที่บ่งชี้ว่าโมเดลสามารถรับงานเป็นงานได้หรือรับได้เพียงเป็นคำถาม นอกจากนี้ยังเป็นตัวเลือกเมื่อพรอมป์ต์ยาวจริง ๆ เพราะอัตราค่าใช้จ่ายไม่มีการกระโดดขั้น และหน้าต่างมีขนาดใหญ่เป็นสองเท่า Grok 4.6 เป็นตัวเลือกสำหรับงานที่อยู่ในรูปคำถามในปริมาณมาก: คะแนน GPQA Diamond 94.9% ที่ราคา $2.00/$6.00 ภายใน 200,000 โทเคนแรกถือเป็นข้อเสนอที่ดีมากสำหรับเวิร์กโหลดแบบดึงข้อมูลและตอบคำถามที่ไม่เคยขยายไปถึงระดับราคาที่เพิ่มเป็นสองเท่า
ทั้งสองอยู่บน OrcaRouter ในราคาตามรายการของผู้ให้บริการโดยบวกเพิ่ม 0% — Claude Opus 5.5 ที่ $4.00/$20.00 พร้อมการอ่านแคชที่ $0.20, Grok 4.6 ที่ $2.00/$6.00 โดยใช้ระดับที่เกิน 200K ตามที่ SpaceXAI กำหนดไว้อย่างตรงเป๊ะ — อยู่หลังคีย์เดียว ดังนั้นการแบ่งข้างต้นจึงสามารถทดสอบกับชุดพรอมป์ของคุณเองได้ แทนที่จะมาเถียงกัน ในจุดที่มีการเราเททั้งสอง ระบบสำรองอัตโนมัติจะอยู่ข้างใต้ ซึ่งมีประโยชน์เมื่อโมเดลที่ถูกกว่าเป็นตัวที่ถือเส้นทางแบบ agentic อยู่
คำตัดสินที่การจับคู่นี้ได้รับ: Grok 4.6 เป็นนักอ่านที่เก่งกว่า และ Claude Opus 5.5 เป็นผู้ทำงานที่เก่งกว่า คะแนน 94.9 บน GPQA Diamond และ 21.21 บน Terminal-Bench คือโมเดลเดียวกันที่ถูกวัดสองครั้ง และการรู้ว่าตัวเลขสองตัวนั้นตัวไหนที่ภาระงานของคุณดูคล้าย คือทั้งหมดของการตัดสินใจ


การเปรียบเทียบในบทความนี้1
ตรวจพบจากบทความนี้ · เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
