การ์ดชื่อเรื่องสำหรับการเปรียบเทียบระหว่าง Grok 4.6 กับ Claude Opus 5 ซึ่งแสดงแท่นสองแท่นที่ได้คะแนน 61 ทั้งคู่ โดยมีใบแจ้งหนี้ขนาดเล็กและขนาดใหญ่ห้อยอยู่ใต้แท่น เพื่อสื่อว่าคะแนนเท่ากันแต่ค่าใช้จ่ายต่างกันมาก
Guides & Insights

Grok 4.6 เทียบกับ Claude Opus 5: ได้ 61 เหมือนกัน แต่เป็นสองเศรษฐกิจที่แตกต่างกัน

ผู้เขียน

Rowan Sterling

วันที่เผยแพร่

โมเดลล่าสุด · 20ดูโมเดลทั้งหมด
เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
กลับไปยังโพสต์ทั้งหมด

Artificial Analysis ใช้การประเมินชุดเดียวกันเก้ารายการกับโมเดลระดับแนวหน้าทุกตัว แล้วเผยแพร่บิล ในดัชนีความฉลาด (Intelligence Index) ของมัน Grok 4.6 และ Claude Opus 5 ต่างก็ได้ตัวเลขเดียวกันที่ 61 ซึ่งถือเป็นการเปรียบเทียบแบบตัวต่อตัวที่หาได้ยาก เพราะคะแนนรวมไม่สามารถบอกคุณได้ว่าควรใช้ตัวไหน สิ่งที่บอกได้คือตัวเลขที่ไม่ค่อยถูกพูดถึงจากแหล่งเดียวกัน: บนชุดทดสอบงานความรู้ AA-Briefcase Grok 4.6 ทำงานหนึ่งงานเสร็จโดยใช้ประมาณ 53 รอบ และโทเคนนำเข้าประมาณห้าร้อยล้านโทเคน ขณะที่ Claude Opus 5 ที่ใช้ความพยายามสูงสุดต้องใช้ประมาณ 103 รอบและสองพันล้านโทเคนสำหรับงานเดียวกัน นั่นคือช่องว่างการบริโภคโทเคนที่ต่างกันสี่ต่อหนึ่งระหว่างสองโมเดลที่มีคะแนนหลักเท่ากัน และความต่างนี้จะเห็นก็ต่อเมื่อคุณหยุดเปรียบเทียบสเปกโมเดลแล้วหันมาเปรียบเทียบบิลแทน

ทั้งสองรุ่นเป็นการเปิดตัวเรือธงล่าสุด ซึ่งทำให้การเปรียบเทียบนี้เป็นไปอย่างสะอาด ไม่ใช่การเทียบรุ่นที่ต่างกัน Grok 4.6 เปิดตัวเมื่อวันที่ 12 สิงหาคม 2026 โดย SpaceXAI ในฐานะการปรับปรุงจากพื้นฐาน Grok 4.5 ซึ่งเป็นฐาน mixture-of-experts ที่มีพารามิเตอร์ 1.5 ล้านล้านเท่าเดิม แต่นำมาฝึกซ้ำด้วยการฝึกแบบมีผู้ดูแลที่ยาวนานขึ้นและการรัน reinforcement-learning ที่มุ่งเป้าไปที่เอเจนต์ที่ทำงานระยะยาว Claude Opus 5 เปิดตัวเมื่อวันที่ 24 กรกฎาคม 2026 โดย Anthropic ในฐานะเรือธงที่ประทับวันที่ตายตัว พร้อม adaptive thinking หน้าต่างบริบท 1 ล้านโทเคน และการรับอินพุตรูปภาพและไฟล์ ทั้งสองอยู่ที่จุดเดียวกันบนกระดานคะแนนอิสระ แต่กลับอยู่คนละฝั่งบนแผ่นราคา: $2 / $6 ต่อล้านโทเคนสำหรับ Grok 4.6 เทียบกับ $5 / $25 สำหรับ Claude Opus 5 งานที่น่าสนใจคือการหาว่าประโยคครึ่งไหนเป็นตัวตัดสินใจเลือกใช้ในโปรดักชันของคุณ

เลข 61 ที่ซ่อนช่องว่างประสิทธิภาพสี่ต่อหนึ่ง

Intelligence Index เป็นองค์ประกอบจากการประเมินเก้าด้าน ซึ่งเป็นทั้งจุดแข็งและจุดบอดของมัน ตัวเลขเพียงค่าเดียวที่เฉลี่ยคะแนนด้านการให้เหตุผล คณิตศาสตร์ การเขียนโค้ด และงานด้านความรู้ ซ่อนวิธีการที่โมเดลไปถึงจุดนั้น — และสองรุ่นนี้ไปถึงจุดนั้นด้วยวิธีที่ตรงข้ามกัน ชุดการทำงานความรู้ระดับมืออาชีพแบบกระเป๋าเอกสารของ Artificial Analysis เองคือหน้าต่างที่ชัดเจนที่สุดในเรื่องนั้น: มันวัดงานระยะยาวจริง และบันทึกว่า Grok 4.6 ใช้ประมาณ 53 เทิร์นและ 0.5 พันล้านโทเค็นอินพุตต่องาน เทียบกับ Claude Opus 5 Max ที่ใช้ประมาณ 103 เทิร์นและ 2 พันล้านโทเค็นอินพุต ในแง่ต้นทุนต่องาน นั่นคือความแตกต่างระหว่างโมเดลที่ทำงานวิจัยและผลิตผลเสร็จโดยใช้โทเค็นเพียงหนึ่งในสี่ กับโมเดลที่เผาผลาญโทเค็นไปหมด

สาเหตุคือการเลือกเชิงออกแบบ ไม่ใช่บั๊ก Grok 4.6 ถูกฝึกมาโดยเฉพาะให้ตรวจสอบงานของตัวเองไปพร้อมกับทำงาน และหยุดเมื่องานย่อยเสร็จสมบูรณ์จริง ๆ — xAI อธิบายว่าเส้นทางงานที่ยาวพร้อมการทดสอบตัวเองคือวัตถุประสงค์ของการฝึก ส่วน Claude Opus 5 ถูกฝึกเพื่อความลึกของการใช้เหตุผลและความกว้างของความรู้ และพฤติกรรมพื้นฐานของมันคือการคิดให้หนักขึ้นและค้นคว้าให้มากเกินกว่าที่จำเป็นอย่างเคร่งครัด ทั้งคู่เป็น "โมเดลใช้เหตุผล" แต่พวกมันจัดสรรความพยายามต่างกัน และการจัดสรรนั้นคือสเปกที่สำคัญต่องานของเอเจนต์

The OrcaRouter model page for grok/grok-4.6, showing the New and Featured badges, the $2.00 per million input and $6.00 per million output pricing, a 500K token context window, and the released August 12, 2026 label.

ช่องว่างนี้สำคัญที่สุดสำหรับเอเจนต์ที่เรียกโมเดลในลูป — เอเจนต์วิจัย, โค้ดเอเจนต์ที่รันหลายสิบเทิร์น, ไปป์ไลน์เอกสารที่ประมวลผลแบตช์ข้ามคืน ทุกเทิร์นถูกคิดเงิน และทุกอินพุตโทเคนคือบริบทที่ต้องส่งซ้ำในการเรียกครั้งถัดไป โมเดลที่จบใน 53 เทิร์นที่ 0.5B โทเคนไม่ได้ถูกกว่าต่อโทเคนเท่านั้น; มันถูกกว่าต่องานประมาณหนึ่งลำดับความสำคัญเมื่อเทียบกับโมเดลที่ใช้ 103 เทิร์นที่ 2B โทเคน ก่อนที่คุณจะคูณด้วยราคารายการด้วยซ้ำ

แผ่นข้อมูลจำเพาะทั้งสองด้าน

ในส่วนที่ต่างกันบนกระดาษ ให้เขียนแต่ละส่วนในหนึ่งบรรทัด:

ดัชนีความฉลาด — Grok 4.6 ได้คะแนน 61 อยู่อันดับที่ 6 จาก 184; Claude Opus 5 ได้คะแนน 61 อยู่อันดับร่วมที่ด้านบนสุด เสมอกันตามการวิเคราะห์ของ Artificial Analysis.

ราคาตามรายการต่อ 1M โทเคน — Grok 4.6 ที่ $2 ต่อ input / $6 ต่อ output (เพิ่มเป็นสองเท่าเป็น $4 / $12 สำหรับพรอมป์ท์ที่มี input ตั้งแต่ 200K โทเคนขึ้นไป); Claude Opus 5 ที่ $5 ต่อ input / $25 ต่อ output พร้อมส่วนลดแบบ batch 50% เหลือ $2.50 / $12.50.

หน้าต่างบริบท — 500K โทเคนสำหรับ Grok 4.6 เทียบกับ 1,000,000 สำหรับ Claude Opus 5 ซึ่งเป็นข้อได้เปรียบด้านสเปกที่ชัดเจนที่สุดเพียงข้อเดียวที่โมเดลใดโมเดลหนึ่งมี

เอาต์พุตสูงสุด — Claude Opus 5 รองรับเอาต์พุตได้สูงสุด 128K โทเคน (300K ผ่าน API แบบแบตช์); เพดานเอาต์พุตของ Grok 4.6 ต่ำกว่า อยู่ในช่วงของคำตอบยาวทั่วไป

อินพุต — ทั้งคู่รองรับข้อความและรูปภาพ; Claude Opus 5 ยังรองรับไฟล์ และเวอร์ชันอินพุตหลายรูปแบบของ Anthropic เข้าถึงเอกสารได้โดยตรงยิ่งขึ้น

GDPVal-AA v2 (งานความรู้) — Grok 4.6 ที่ 1,753 Elo เทียบกับ Claude Opus 5 ที่ 1,852 Elo Opus 5 คว้ามงกุฎคุณภาพงานความรู้ในตัวชี้วัดที่ประสิทธิภาพกระเป๋าเอกสารเข้าข้าง Grok [Artificial Analysis]

CursorBench v3.2 — 69.9% สำหรับ Grok 4.6 เทียบกับ 70.0% สำหรับ Claude Opus 5 ซึ่งถือว่าเสมอกันในทางปฏิบัติ บนเกณฑ์วัดเอเจนต์เขียนโค้ดที่ทั้งคู่ถูกวัด [Artificial Analysis]

การควบคุมการใช้เหตุผล — Claude Opus 5 มีตัวปรับระดับความพยายามตั้งแต่ต่ำถึงสูงสุด และเปิดใช้การคิดแบบปรับตัวตามค่าเริ่มต้น ส่วน Grok 4.6 แสดงระดับการใช้เหตุผล แต่ถูกปรับให้ค่าเริ่มต้นเอื้อต่อเส้นทางของเอเจนต์ที่ยาว

การวางทั้งสองรุ่นเทียบเคียงกันนั้นก็เพื่อแสดงว่าไม่มีรุ่นใดที่เหนือกว่าอย่างชัดเจน Claude Opus 5 เป็นตัวเลือกทั่วไปที่ดีกว่าในทางทฤษฎี: มีบริบทยาวกว่า, ขีดจำกัดผลลัพธ์สูงกว่า, รองรับไฟล์เข้า, และคุณภาพงานเชิงความรู้สูงกว่า Grok 4.6 ให้ความคุ้มค่าเหนือกว่าและเป็นเอเจนต์ที่มีประสิทธิภาพมากกว่า คำถามเดียวที่เหลืออยู่คือความสามารถแบบไหนที่ตรงกับงานที่คุณทำจริง

A comparison scoreboard for Grok 4.6 and Claude Opus 5: both score 61 on the AA Intelligence Index; Grok 4.6 lists at $2/$6 with 500K context, GDPVal-AA v2 of 1,753, an AA-Briefcase spend of 0.5B tokens and CursorBench v3.2 of 69.9%, versus Claude Opus 5 at $5/$25 with 1M context, GDPVal-AA v2 of 1,852, an AA-Briefcase spend of 2B tokens and CursorBench v3.2 of 70.0%.

จุดที่ Claude Opus 5 คุ้มค่ากับราคาพรีเมียม

{{1}}ตัวเลขเปิดตัวของ Anthropic{{/1}} — {{2}}รายงานโดยผู้พัฒนาระบบเอง ไม่ได้ผ่านการตรวจสอบซ้ำโดยอิสระ{{/2}} — {{3}}ระบุว่า Claude Opus 5 ทำคะแนนได้ 96.0% ในการทดสอบ SWE-bench Verified และ 79.2% ใน SWE-bench Pro{{/3}} {{4}}พร้อมคะแนน OSWorld 70.6% สำหรับการใช้งานคอมพิวเตอร์{{/4}} {{5}}ในการวัดผลแบบองค์รวม คะแนน 61 ของมันเทียบเท่ากับ Grok 4.6{{/5}} {{6}}และบน GDPVal-AA มันนำอยู่อย่างชัดเจน{{/6}} {{7}}สิ่งที่สิ่งนี้แปลผลได้ในทางปฏิบัติ{{/7}} {{8}}คือโมเดลที่รับมือได้ดีตลอดทั้งวันทำงานของพนักงานความรู้{{/8}}: {{9}}การร่างเอกสาร การวิเคราะห์ การให้เหตุผลกับเอกสารยาว งานที่ผสมภาพและข้อความ และการเขียนโค้ด{{/9}} {{10}}ทั้งหมดในที่เดียว{{/10}} {{11}}พร้อมความจุหนึ่งล้านโทเคน{{/11}}

หน้าต่างบริบทคือเหตุผลที่แท้จริงในการเลือกใช้มัน {{1}}ขีดจำกัด 500K โทเคน{{/1}}นั้นใหญ่ แต่มันไม่ใช่{{2}}โค้ดเบสทั้งหมดบวกกับคอร์ปัสงานวิจัยบวกกับผลลัพธ์ขั้นกลางของเซสชันเอเจนต์ที่ยาวนาน{{/2}} ทีมที่ทำ{{3}}การวิเคราะห์เชิงลึกแบบผ่านข้อมูลเพียงครั้งเดียวบนคลังข้อมูลขนาดใหญ่มาก{{/3}} — {{4}}คลังโค้ดทั้งหมด เอกสารทางการเงินหนึ่งปี กองเอกสาร PDF ยาวเหยียด{{/4}} — จะชน{{5}}เพดานของ Grok 4.6{{/5}} และไม่มีทางถึง{{6}}เพดานของ Claude Opus 5{{/6}} สำหรับเวิร์กโหลดเหล่านั้น บริบทที่เพิ่มขึ้นมาไม่ใช่สิ่งฟุ่มเฟือย {{7}}มันคือความแตกต่างระหว่างการที่งานพอดีลงไปได้ กับการต้องวางแผนจัดการรอบ ๆ ขีดจำกัด{{/7}}

จุดที่ Grok 4.6 เป็นตัวเลือกที่คุ้มค่ากว่า

เมื่อพลิกข้อเท็จจริงชุดเดียวกัน Grok 4.6 กลับเป็นตัวเลือกที่ดีกว่าสำหรับไปป์ไลน์เอเจนต์ และไม่ใช่ดีกว่าเพียงเล็กน้อยเลย มันมีต้นทุนถูกกว่า 2.5 เท่าในด้านอินพุต และถูกกว่า 4.2 เท่าในด้านเอาต์พุต เทียบกับราคาป้ายของ Opus 5 และประสิทธิภาพการใช้โทเคนต่องานของมันยิ่งตอกย้ำจุดนั้น ตัวเลขจาก AA-Briefcase บ่งชี้ว่าต้องใช้โทเคนน้อยลงประมาณ 4 เท่า และใช้เทิร์นน้อยลงประมาณ 2 เท่า เพื่อให้ได้ผลลัพธ์ของงานเชิงความรู้ (knowledge-work) แบบเดียวกัน คูณ 4 เท่ากับ 2.5 เท่า และงานที่ต้นทุน 1.00 ดอลลาร์ตามโครงสร้างราคาของ Opus 5 จะกลายเป็นต้นทุนราว 0.10 ดอลลาร์ตามโครงสร้างของ Grok 4.6 — ก่อนที่ส่วนลดแบบแบตช์จากฝั่ง Opus จะเข้ามาปิดช่องว่างบางส่วน

ในส่วนของการเขียนโค้ดแบบ agentic โดยเฉพาะ ผลลัพธ์ DeepSWE 1.1 ของ Grok 4.6 ดีขึ้นจาก 54% เป็น 65.9% ระหว่างเวอร์ชัน 4.5 และ 4.6 ส่วนคะแนน CursorBench ก็ห่างจากของ Opus 5 ไม่ถึงครึ่งจุด พร้อมทั้งตรวจสอบความถูกต้องของงานตัวเองไปด้วยตลอดทาง สำหรับทีมที่เรียกใช้งาน agentic เป็นพันครั้งต่อวัน ซึ่งแต่ละครั้งเป็นลูปแบบหลายเทิร์น ความคุ้มค่าต่องานและเส้นทางที่สั้นลงคือตัวชี้ขาดระหว่างผลิตภัณฑ์ที่ใช้งานได้จริงกับอัตราการเผาผลาญเงินทุน นั่นคือกรณีที่ xAI กำลังนำเสนอ และข้อมูลประสิทธิภาพจากแหล่งอิสระก็หนุนทิศทางดังกล่าว

การตัดสินใจเส้นทาง

นี่คือการแข่งขันที่เราเตอร์พิสูจน์คุณค่า เพราะคำตอบที่ถูกต้องคือ "ทั้งคู่ โดยแบ่งตามลักษณะของปริมาณงาน" Grok 4.6 และ Claude Opus 5 ต่างก็เปิดให้ใช้งานบน OrcaRouter ในราคารายการของแต่ละผู้ให้บริการ — $2 / $6 สำหรับ grok/grok-4.6, $5 / $25 สำหรับ anthropic/claude-opus-5 — โดยมีมาร์กอัป 0% ดังนั้นตัวเลขในโมเดลต้นทุนของคุณคือตัวเลขที่ถูกเรียกเก็บจริง กลไกที่ทำให้การแยกนี้ใช้งานได้จริง: คีย์ API เดียวสำหรับทั้งสองโมเดล, การเฟลโอเวอร์อัตโนมัติหากเอนด์พอยต์ของผู้ให้บริการรายหนึ่งเสื่อมประสิทธิภาพระหว่างการรันเอเจนต์ระยะยาว, และ DSL สำหรับการจัดเส้นทางที่สามารถส่งเทิร์นสั้นๆ ปริมาณมากไปยัง Grok 4.6 และส่งต่องานระยะยาวที่ต้องการบริบทมากไปยัง Claude Opus 5 ภายในคอลเดียว คุณไม่จำเป็นต้องมีสัญญาเพิ่มเติมเพื่อรันสถาปัตยกรรมสองระดับ และคุณสามารถปรับการแยกใหม่ได้เมื่อข้อมูลทราฟฟิกจริงเข้ามา แทนที่จะเดาจากโมเดลการ์ด

The OrcaRouter model page for anthropic/claude-opus-5, showing the $5.00 per million input and $25.00 per million output pricing, the 1M token context window, and the 128K max output tokens.

การอ่านอย่างตรงไปตรงมา

ความเสมอกันบนดัชนีรวมนั้นมีจริง และมันคือกับดัก โมเดลที่ได้คะแนนเท่ากันไม่ได้ใช้แทนกันได้ พวกมันถูกแยกความแตกต่างตรงจุดที่คะแนนมองไม่เห็นพอดี Claude Opus 5 เป็นตัวเลือกเริ่มต้นที่ปลอดภัยกว่าสำหรับงานความรู้แนวกว้าง เน้นบริบทหนัก และทำงานกับเอกสารและรูปภาพ ซึ่งหน้าต่าง 1M token และการให้เหตุผลเชิงลึกสำคัญกว่าต้นทุน Grok 4.6 เป็นตัวเลือกเริ่มต้นที่ดีกว่าสำหรับลูปเอเจนต์ปริมาณสูง ซึ่งประสิทธิภาพของ token ต่องานและข้อได้เปรียบด้านราคา 2.5 เท่าทบต้นจนกลายเป็นความต่างของบิลระดับสิบเท่า หากปริมาณงานของคุณเป็นแบบแรก จ่ายเงินซื้อ Opus 5 แล้วเลิกกังวลเรื่องราคาได้เลย หากเป็นแบบหลัง ความเท่าเทียมที่คะแนน 61 บนกระดาษคือเหตุผลที่ดีที่สุดที่คุณจะมีในการทดสอบ Grok 4.6 ก่อน — เกณฑ์ชี้วัดบอกว่ามันเท่ากัน แต่ใบแจ้งหนี้บอกว่าไม่เท่ากัน

การเปรียบเทียบในบทความนี้1

ตรวจพบจากบทความนี้ · เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน

© 2026 OrcaRouter

สำหรับผู้ให้บริการ

ให้บริการแพลตฟอร์มการอนุมานอยู่หรือไม่ นำโมเดลของคุณขึ้น OrcaRouter

providers@orcarouter.ai

เข้าร่วมคอมมูนิตี้ของเรา

Discordsupport@orcarouter.aiXGitHubYouTube